시작하기 전에

이 15분 자습서에서는 Oracle Analytics에서 보고 및 분석을 위해 선별된 두 개의 데이터 집합으로 데이터 플로우를 생성하는 방법을 보여줍니다.

배경

이 자습서에서는 두 개의 스프레드시트 파일에서 생성된 데이터 집합을 사용하여 데이터 플로우를 생성합니다. 소스 데이터 집합을 변환 및 수정하여 선별된 데이터 집합을 생성하는 함수의 그래픽 표현을 사용하여 데이터 흐름에서 별도의 소스의 데이터를 결합하는 방법을 배웁니다.

데이터 플로우에서 변환 열을 사용하여 기부 데이터 집합을 수정하고, 열을 필터링, 추가하고, 열 단계를 선택합니다. zip stats 데이터 집합을 데이터 플로우에 추가하고 열을 변환하여 각 데이터 집합의 데이터를 조인합니다. 데이터 집합을 조인한 후 열 선택 단계를 사용할 필요가 없는 열을 제거합니다. Aggregate 단계를 추가하여 measure 열과 함께 사용되는 함수를 정의하고 표현식이 있는 열을 추가합니다. 모든 데이터 플로우는 데이터 집합 저장 단계로 끝납니다. 데이터 플로우를 실행하여 소스 데이터에서 데이터 집합을 생성합니다.

이 자습서는 Oracle Analytics Cloud에서 데이터 준비 및 분석 시리즈의 첫 번째 자습서입니다. 데이터 플로우를 사용하여 데이터 집합을 생성하는 방법을 배우려는 경우 첫번째 자습서 이후 시리즈를 종료할 수 있습니다. 자습서를 나열된 순서대로 읽습니다.

필요 사항

데이터 집합 생성

이 절에서는 donation2024.xlsx 파일을 사용하여 데이터 세트를 만듭니다.

  1. Oracle Analytics에 사인인합니다.
  2. 홈 페이지에서 생성, 데이터 집합을 차례로 누릅니다.
  3. 데이터 집합 생성에서 여기에 데이터 파일 놓기 또는 눌러서 찾아보기를 누릅니다. 파일 업로드에서 donation2024.xlsx 파일을 선택한 다음 열기를 누릅니다.
  4. donation2024.xlsx의 데이터 집합 테이블 생성에서 확인을 누릅니다.
  5. 저장을 누릅니다저장 아이콘. 다른 이름으로 데이터 집합 저장에서 이름donations2024을 입력한 다음 확인을 누릅니다.


    다음은 donation_dataset.png에 대한 설명입니다.
    그림 donation_dataset.png에 대한 설명
  6. donations2024 데이터 집합 페이지에서 뒤로 이동 뒤로 아이콘을 누릅니다.

두 번째 데이터 세트 추가

이 절에서는 donations2024 데이터 세트에 대한 인구 통계를 제공하는 데이터 세트를 만듭니다.

  1. 홈 페이지에서 생성, 데이터 집합을 차례로 누릅니다.
  2. 데이터 집합 생성에서 여기에 데이터 파일 놓기 또는 눌러서 찾아보기를 누릅니다. 파일 업로드에서 zip_stats.xlsx 파일을 선택한 다음 열기를 누릅니다.
  3. zip_stats.xlsx의 데이터 집합 테이블 생성에서 확인을 누릅니다.


    다음은 zip_stats_join_diagram.png에 대한 설명입니다.
    그림 zip_stats_join_diagram.png에 대한 설명
  4. 저장을 누릅니다저장 아이콘. 다른 이름으로 데이터 집합 저장에서 이름zip stats을 입력한 다음 확인을 누릅니다.
  5. 뒤로 이동 뒤로 아이콘을 누릅니다.

데이터 플로우 생성

이 섹션에서는 데이터 플로우를 생성하고 데이터를 수정하는 단계를 추가합니다. 또한 데이터 집합에서 NULL 값을 제거하는 필터를 생성합니다.

  1. 홈 페이지에서 생성, 데이터 흐름을 차례로 누릅니다.
  2. 데이터 추가에서 donations2024 데이터 세트를 선택한 다음 추가를 누릅니다.


    데이터 플로우가 첫번째 노드로 donations2024를 사용하여 열립니다.

    다음은 df_first_node.png에 대한 설명입니다.
    그림 df_first_node.png에 대한 설명
  3. donations2024 노드에서 단계 추가(단계 추가 아이콘)를 누릅니다. 필터 필터 단계 아이콘를 선택합니다.
  4. 필터에서 필터를 추가하려면 여기를 누르거나 필터를 끄십시오를 선택합니다. 사용 가능한 데이터에서 DATE_COMPLETED을 선택합니다.
  5. DATE_COMPLETED의 일자 범위 아래에서 범위를 값으로 유지합니다. 첫번째 필드에 시작 날짜로 1/1/2019를 입력합니다. 두번째 필드에 종료 날짜로 10/31/2023를 입력한 다음 대화상자 외부를 누릅니다.


    필터는 일자 완료 값이 없는 레코드를 제거합니다.

    다음은 date_completed_filter.png에 대한 설명입니다.
    그림 date_completed_filter.png에 대한 설명
  6. Save를 누릅니다. 다른 이름으로 데이터 플로우 저장에서 School Donations을 입력한 다음 확인을 누릅니다.

표현식으로 열 추가

이 섹션에서는 표현식을 정의하여 열을 생성합니다. 이 자습서에서 복사하는 대신 수동으로 표현식을 입력합니다.

  1. 데이터 플로우 단계에서 열 추가를 끌어 필터 노드에서 단계 추가 단계 추가 아이콘를 수행합니다. 이름SCH_STATE을 입력합니다. 표현식 필드에 다음을 입력합니다.

    SUBSTRING(SCH_STATEZIP FROM 1 FOR 2)

  2. 검증, 적용 순으로 누릅니다.


    다음은 add_column_sch_state.png에 대한 설명입니다.
    그림 add_column_sch_state.png에 대한 설명
  3. [열 추가]에서 Add Column 아이콘을 누릅니다. 이름SCH_ZIP을 입력합니다. 표현식 필드에 다음을 입력합니다.

    CAST(SUBSTRING(SCH_STATEZIP FROM 4) AS int)

  4. 검증, 적용 순으로 누릅니다.
  5. 열 추가 단계 추가 아이콘를 누릅니다. 이름YR_COMPLETED을 입력합니다. 표현식 필드에 다음을 입력합니다.

    YEAR(DATE_COMPLETED)

  6. 검증, 적용을 차례로 누릅니다.
  7. SCH_ZIP 열을 선택하고 옵션 옵션 아이콘을 누른 다음 텍스트로 변환을 선택합니다.
  8. 검증을 누르고 적용을 누르십시오.
  9. YR_COMPLETED 열을 선택하고 옵션 옵션 아이콘을 누른 다음 텍스트로 변환을 선택합니다. 검증, 적용 순으로 누릅니다.


    다음은 add_columns.png에 대한 설명입니다.
    그림 add_columns.png에 대한 설명

데이터 플로우에 데이터 집합 추가

이 섹션에서는 데이터 플로우에 zip stats 데이터 집합을 추가합니다.

  1. 데이터 플로우 단계에서 데이터 추가를 두 번 누릅니다. 데이터 추가에서 zip stats, Add 순으로 누릅니다.
  2. 조인 노드를 누르고 입력 1 목록에서 모든 행을 선택합니다. 일치 열에서 PROJECTID를 누르고 입력 1 값에 대해 SCH_ZIP를 선택합니다.
  3. zip stats 노드를 누릅니다. Zip 열을 선택하고 옵션 옵션 아이콘을 누른 다음 텍스트로 변환을 선택합니다.
  4. 검증을 누르고 적용을 누르십시오.


    Zip 열을 텍스트로 변환하면 데이터 세트 간의 조인이 검증됩니다.

    다음은 join_transformation.png에 대한 설명입니다.
    그림 join_transformation.png에 대한 설명

열 선택

이 섹션에서는 조인된 데이터 집합에서 사용할 열을 선택합니다.

  1. 데이터 플로우 단계에서 조인 노드의 열 선택단계 추가 단계 추가 아이콘로 끌어옵니다.


    다음은 select_columns.png에 대한 설명입니다.
    그림 select_columns.png에 대한 설명
  2. 열 선택 아래에서 모두 제거를 누릅니다. 다음 열을 선택하고 선택한 항목 추가를 누릅니다.
    • 프로젝트 ID
    • SCHOOL_ID
    • PRIMARY_FOCUS_SUBJECT
    • RESOURCE_TYPE
    • POVERTY_LEVEL
    • GRADE_LEVEL
    • STUDENTS_REACHED
    • TOTAL_DONATIONS
    • NUM_DONORS
    • SCH_STATE
    • SCH_ZIP
    • 연도 완료
    • Median
    • 인구
  3. 데이터 플로우 단계에서 집계를 두 번 눌러 [열 선택] 노드에 이 단계를 추가합니다.
  4. 그룹화 기준에서 PROJECTID 행 옆에 있는 삭제 아이콘 제거를 누릅니다.
  5. 집계 아래의 함수 목록에서 다음 행에서 평균을 선택합니다.
    • STUDENTS_REACHED
    • TOTAL_DONATIONS
    • NUM_DONORS
    • Median
    • 인구
  6. 집계에서 집계 추가를 누르고 PROJECTID를 선택합니다. 함수 목록에서 개수를 선택한 다음 새 열 이름Number of Projects를 입력합니다. 중간값 행의 새 열 이름Income을 입력합니다.


    다음은 aggregate_columns.png에 대한 설명입니다.
    그림 aggregate_columns.png에 대한 설명

집계 정의

이 섹션에서는 집계 단계를 사용하여 데이터 집합의 측정 단위 열에 사용할 함수를 설정합니다.

  1. 데이터 플로우 단계에서 열 추가를 집계 노드의 단계 추가 단계 추가 아이콘로 끌어옵니다.
  2. 이름Donation by Population을 입력합니다.
  3. 표현식 필드에 다음을 입력합니다.

    TOTAL_DONATIONS Average/Population Average

  4. 검증을 누릅니다. 적용을 누릅니다.
  5. [열 추가]에서 Add Column 아이콘을 누릅니다. 이름Average School Donation by Income을 입력합니다.
  6. 표현식 필드에 다음을 입력합니다.

    avg(TOTAL_DONATIONS Average by SCHOOL_ID)/Income

  7. 검증을 누르고 적용을 누르십시오.


    다음은 new_columns_after_join.png에 대한 설명입니다.
    그림 new_columns_after_join.png에 대한 설명

데이터플로우 저장 및 실행

이 섹션에서는 데이터 플로우 실행 결과를 가져온 데이터 집합의 이름을 지정하고 새 데이터 집합의 열을 검사합니다. 다음 튜토리얼에서는 학교별 기부금 데이터 세트를 사용합니다.

  1. 데이터 플로우 단계에서 데이터 집합 저장을 두 번 누릅니다.
  2. 데이터 세트 저장에서 이름Donations by School을 입력합니다. [데이터 저장]에서 데이터 집합 저장 영역을 선택하여 Oracle Analytics에 데이터를 저장합니다.
  3. 프로젝트 수 행의 일자 세트 저장에서 기본 집계 열의 합계를 누르고 개수를 선택합니다.
  4. 모집단별 기부금 및 평균 학교 기부금 행의 기본 집계 열에서 합계를 누르고 평균을 선택합니다.
  5. Save를 누릅니다.


    다음은 add_columns_after_join.png에 대한 설명입니다.
    그림 add_columns_after_join.png에 대한 설명
  6. 데이터 흐름 실행을 누릅니다 데이터 플로우 실행 아이콘.
  7. 데이터 플로우 실행이 성공적으로 완료된 후 뒤로 이동 뒤로 아이콘을 누릅니다.
  8. 홈 페이지에서 데이터를 누른 다음 학교별 기부 데이터 집합을 선택합니다. 작업 작업 아이콘을 누른 다음, 검사를 선택합니다.
  9. 데이터 집합 대화상자에서 데이터 요소를 눌러 열을 봅니다.


    다음은 donationsbysch_dataset.png.png에 대한 설명입니다.
    그림 donationsbysch_datase.png에 대한 설명

다음단계

데이터 분석

더 알아보기