Oracle AI Data Platform 및 OCI Data Science를 사용하여 확장 가능한 머신 러닝 워크플로우 구현

AI Data Platform과 Data Science를 함께 사용하여 Oracle Cloud Infrastructure에서 확장 가능한 머신 러닝 워크플로우를 제공할 수 있습니다.

이 솔루션은 두 플랫폼의 강점을 결합합니다.

  • AI 데이터 플랫폼: 중앙 집중식 및 관리형 데이터 관리, 대규모 Spark 처리, 워크플로 통합관리, 메달리온 데이터 아키텍처를 제공합니다.
  • 데이터 사이언스: 노트북 및 작업 기반 머신 러닝 개발, 모델 배포 및 프로덕션 워크로드를 위한 모델 서비스를 위한 유연한 런타임 환경과 인프라를 제공합니다.

이 아키텍처는 중앙 집중식 엔터프라이즈 데이터 플랫폼, 대규모 데이터 처리, 중간 규모에서 대규모 머신 러닝 워크로드, 데이터 엔지니어와 데이터 과학자 간의 협업을 지원하도록 설계되었습니다.

일반적인 사용 케이스에는 다음이 포함됩니다.

  • 소매 예측: 과거 및 새로 수집한 데이터를 기반으로 일일 수요 예측을 생성합니다.
  • 보험 갱신 최적화: 보험 갱신 가격을 최적화하여 마진을 극대화하고 비즈니스 제약 조건을 충족합니다. 매주 새 갱신 제안 배치가 생성됩니다.
  • 텔레콤 로그 이벤트 모니터링 및 드리프트 감지: 대규모 운영 이벤트 스트림을 분석하여 데이터 드리프트를 감지하고, 이상을 식별하고, 일일 보고서 및 인사이트를 생성합니다.

구조

AI Data Platform 및 Data Science가 확장 가능한 머신 러닝 아키텍처를 지원하는 방법을 알아보십시오.

이 다이어그램은 이 참조 구조를 보여줍니다.


다음은 aidp-ml-workloads-architecture.png에 대한 설명입니다.
그림 Aidp-ml-workloads-architecture.png에 대한 설명

aidp-ml-workloads-architecture-oracle.zip#GUID-73867B97-5BE4-434A-85C4-097DB840B323

아키텍처는 4개의 기본 도메인으로 구분됩니다.

AI Data Platform(AIDP)

AI Data Platform은 데이터 수집, 변환, 거버넌스 및 준비를 담당합니다.

  • 데이터 통합: Apache Kafka와 함께 OCI Data Integration 및 OCI Streaming과 같은 다양한 도구를 사용하여 다양한 엔터프라이즈 소스에서 데이터 수집
  • AI 레이크하우스: 확장성 및 동적 스토리지
  • Spark 워크플로우: Bronze, Silver 및 Gold 계층이 있는 Medallion 아키텍처를 사용하여 확장 가능한 데이터 처리 및 변환
  • 에이전트 흐름: 자연어 데이터 상호 작용

이러한 리소스는 주로 데이터 엔지니어가 만들고 관리합니다.

데이터 과학 플랫폼

Data Science는 R&D 및 프로덕션 단계에서 사용되는 다양한 리소스를 사용하여 머신 러닝 수명 주기를 관리합니다.

연구 및 개발 단계는 다음을 포함합니다:

  • 노트북 세션: ML 실험 및 모델 교육
  • 모델 카탈로그: 모델 버전 관리 및 모델 관리
  • 모델 배치: sclalable 모델 제공을 위한 배치

생산 단계에는 반복 가능한 뱃치 추론 파이프라인 및 생산 자동화를 위한 스케줄링된 작업 자동화가 포함됩니다.

OCI 모니터링

OCI Monitoring은 데이터 드리프트 및 모델 드리프트와 관련된 모니터링, 시각화 및 경고를 위해 두 플랫폼 전반에 걸쳐 중앙 집중식 운영 가시성을 제공합니다. OCI Monitoring은 운영 안정성 및 운영 준비 상태를 보장합니다.

플랫폼 상호 작용

데이터 사이언스 플랫폼과 AI 데이터 플랫폼 간의 상호 작용은 주로 다음과 같은 목적으로 사용됩니다.

  • Data Science 플랫폼은 모델 학습(과거 데이터) 및 생산 자동화(점수부여가 필요한 새로운 사례) 모두에 대해 AI Data Platform에서 관리하는 데이터를 검색합니다.
  • Data Science 플랫폼은 새로 처리된 사례에 대한 예측 점수를 추가하여 데이터를 강화합니다.

교육 및 생산 자동화에 사용되는 데이터 계층은 데이터 엔지니어가 정의한 스키마 및 아키텍처에 따라 애플리케이션마다 다를 수 있습니다. 대부분의 경우 데이터는 선별된 Silver 레이어에서 가져오지만 Bronze 또는 Gold 레이어 또는 여러 레이어의 조합에서 가져올 수도 있습니다.

마찬가지로 예측 점수를 포함하는 풍성한 데이터는 종종 Gold 계층에 기록되지만 응용 프로그램의 요구 사항 및 데이터 아키텍처에 따라 다른 데이터 계층에도 저장될 수 있습니다.

데이터 드리프트 감지에 사용되는 데이터는 특정 사용 사례 및 데이터 아키텍처에 따라 브론즈, 실버 또는 골드 레이어에서 생성될 수 있습니다.

구조 구성 요소

  • Oracle AI Data Platform

    Oracle AI Data Platform은 데이터 자산 전반의 데이터 카탈로그화, 준비 및 분석을 간소화하는 통합 플랫폼입니다. 통합 사용자 경험 내에 데이터, AI, 분석 및 거버넌스를 결합하여 안전하고 확장 가능한 AI 기반 애플리케이션을 구축할 수 있습니다. Oracle AI Data Platform은 Autonomous AI Lakehouse, Oracle Analytics Cloud, OCI Object Storage, OCI Generative AI, Fusion Data Intelligence를 통합합니다.

    이 플랫폼 내에서 Oracle AI Data Platform Workbench는 데이터 파이프라인 및 모델을 설계, 통합관리 및 배포하고, RBAC 정책을 설정하고, Spark와 같은 오픈 소스 기술을 사용하여 데이터를 준비, 분석 및 보강할 수 있는 전용 개발 환경을 제공합니다.

  • OCI 데이터 통합

    Oracle Cloud Infrastructure Data Integration은 데이터 파이프라인의 설계 및 실행을 위한 완전 관리형 서버리스 서비스입니다. 자율운영 AI 레이크하우스(Autonomous AI Lakehouse) 및 OCI Object Storage와 같은 OCI 타겟으로 데이터를 원활하게 추출, 변환, 로드할 수 있습니다. 사용자는 실행 환경을 자동 확장하는 코드 없는 직관적인 인터페이스를 통해 통합 플로우를 구축할 수 있습니다. Spark 기반 프로세싱을 통한 ETL과 성능 및 효율성을 위한 SQL 푸시다운을 사용하는 ELT를 모두 지원합니다. 이 서비스는 또한 데이터 준비를 위한 도구를 제공하며 규칙 기반 처리를 통해 스키마 드리프트로부터 보호합니다.

  • Data Science

    Oracle Cloud Infrastructure Data Science는 데이터 과학 팀이 OCI에서 머신 러닝(ML) 모델을 구축, 교육 및 관리하는 데 사용할 수 있는 완전 관리형 서버리스 플랫폼입니다. Oracle Autonomous AI Lakehouse, Oracle Cloud Infrastructure Object Storage 등과 같은 다른 OCI 서비스와 쉽게 통합할 수 있습니다. 엔터프라이즈 신뢰할 수 있는 데이터를 신속하게 작동시켜 비즈니스 유연성을 높이는 고품질 머신 러닝 모델을 구축하고 평가할 수 있으며, ML 모델을 보다 쉽게 배포하여 데이터 기반 비즈니스 목표를 지원할 수 있습니다.

  • OCI Identity and Access Management

    Oracle Cloud Infrastructure Identity and Access Management(IAM)는 OCI 및 Oracle Cloud Applications에 대한 사용자 액세스 제어를 제공합니다. IAM API 및 사용자 인터페이스를 통해 ID 도메인 및 해당 도메인 내의 리소스를 관리할 수 있습니다. 각 OCI IAM ID 도메인은 독립형 ID 및 액세스 관리 솔루션 또는 다른 사용자 모집단을 나타냅니다.

  • OCI 모니터링

    Oracle Cloud Infrastructure Monitoring은 클라우드 리소스를 능동적이고 수동적으로 모니터링하고, 측정항목이 지정된 트리거를 충족할 때 알람을 사용하여 통지합니다.

  • OCI 오브젝트 스토리지

    OCI Object Storage는 데이터베이스 백업, 분석 데이터, 이미지 및 비디오와 같은 리치 콘텐츠 등 모든 콘텐츠 유형의 대량의 정형 및 비정형 데이터에 대한 액세스를 제공합니다. 애플리케이션 또는 클라우드 플랫폼 내에서 직접 안전하고 안전하게 데이터를 저장할 수 있습니다. 성능 또는 서비스 안정성이 저하되지 않고 스토리지를 확장할 수 있습니다.

    신속하고 즉각적이며 자주 액세스해야 하는 "핫" 스토리지에 표준 스토리지를 사용합니다. 장기간 보관하며 거의 또는 거의 액세스하지 않는 "콜드" 스토리지에 아카이브 스토리지를 사용합니다.

  • OCI 지역

    OCI 리전은 가용성 도메인을 호스팅하는 데이터 센터가 하나 이상 포함된 지역화된 지리적 영역입니다. 지역은 다른 지역과 독립적이며, 광대한 거리는 (국가 또는 대륙에서) 그들을 분리 할 수 있습니다.

  • 서비스 게이트웨이

    서비스 게이트웨이는 VCN에서 Oracle Cloud Infrastructure Object Storage와 같은 다른 서비스에 대한 액세스를 제공합니다. VCN에서 Oracle 서비스로의 트래픽은 Oracle 네트워크 패브릭을 통해 이동하며 인터넷을 순회하지 않습니다.

  • OCI Streaming

    Oracle Cloud Infrastructure Streaming은 실시간으로 액세스 및 처리할 수있는 대용량의 연속 데이터 스트림을 입수하기 위한 확장 가능하며 내구성 있는 전담 관리 영구 스토리지 솔루션을 제공합니다. OCI Streaming을 사용하여 애플리케이션 로그, 운영 원격 측정, 웹 클릭-스트림 데이터 같은 대용량 데이터의 수집에 사용하거나, 게시-구독 메시징 모델에서 데이터가 연속적으로 생성되고 처리되는 기타 사용 사례를 입수할 수 있습니다.

  • OCI 가상 클라우드 네트워크 및 서브넷

    VCN(가상 클라우드 네트워크)은 OCI 리전에 설정하는 커스터마이징 가능한 소프트웨어 정의 네트워크입니다. 기존 데이터 센터 네트워크와 마찬가지로 VCN을 사용하면 네트워크 환경을 제어할 수 있습니다. VCN에는 VCN을 생성한 후 변경할 수 있는 겹치지 않는 CIDR(클래스리스 도메인 간 경로 지정) 블록이 여러 개 있을 수 있습니다. VCN을 서브넷으로 분할할 수 있으며, 이 서브넷은 지역 또는 가용성 도메인으로 범위가 지정될 수 있습니다. 각 서브넷은 VCN의 다른 서브넷과 겹치지 않는 연속된 주소 범위로 구성됩니다. 썸네일의 크기는 생성 이후 변경할 수 있습니다. 서브넷은 공용 또는 전용일 수 있습니다.

권장 사항

이러한 권장 사항을 이 참조 아키텍처의 시작점으로 사용합니다.

요구 사항이 다를 수 있습니다.

  • Data Science 작업 및 일정을 사용하여 반복 가능한 추론 파이프라인을 자동화합니다.
  • 데이터 사이언스 배포 및 서비스 도구를 사용하여 확장, 운영 모니터링 및 재현성을 지원합니다.
  • 운영 머신 러닝 워크로드를 모니터링하여 운영 상태, 데이터 드리프트 및 모델 드리프트를 확인합니다.
  • 데이터 엔지니어링 팀과 데이터 과학 팀 간의 명확한 운영 소유권을 확립합니다.

고려사항

이 참조 구조를 배치할 때는 다음 사항을 고려하십시오.
  • 두 플랫폼에서 OCI Identity and Access Management 및 RBAC(역할 기반 액세스 제어) 정책을 구현합니다.
  • 운영 워크로드를 모니터링하여 운영 상태, 데이터 드리프트 및 모델 드리프트를 확인합니다.
  • 장기적인 데이터 보존 및 분석을 위해 확장 가능한 관리형 스토리지를 사용합니다.

자세히 살펴보기

다음 리소스를 사용하여 이 구조에 사용되는 구성 요소에 대해 자세히 알아봅니다.

승인

  • 작성자: Assaf Rabinowicz, Ph.D.
  • 기여자: Ismail Syed, Esmeralda Simionescu, Harry Snart, Massimo Dalla Rovere, Robert Lies