OCI Generative AI 멀티모달 모델 및 엔터프라이즈 AI 에이전트를 사용하여 비디오 분석하기

AI 멀티모달 모델을 사용하여 비디오 파일을 처리하고 회사의 지식 기반에 따라 상세 보고서를 분석 및 생성합니다.

멀티모달 대형 언어 모델(Multimodal Large Language Models, MLLM)은 비디오의 이미지와 프레임을 확장하여 이해할 수 있습니다.

비디오는 일련의 프레임이며, 각 프레임은 멀티모달 LLM이 분석할 수 있는 이미지입니다. 다음 참조 아키텍처는 이 기능을 활용하여 Oracle Cloud Infrastructure(OCI)에서 범용 배치 비디오 분석 파이프라인을 구축합니다. 비디오는 Oracle Cloud Infrastructure Object Storage에 업로드되고, Oracle Cloud Infrastructure Events에서 자동으로 감지되며, Oracle Cloud Infrastructure Compute 인스턴스에서 처리됩니다. 이 인스턴스는 프레임으로 분해하고, Oracle Cloud Infrastructure Speech를 사용하여 음성 오디오를 변환하고, AI 모델을 통해 시각적 및 오디오 콘텐츠를 분석하고, 결과를 일관된 보고서로 합성합니다.

처리 파이프라인을 형성하는 네 가지 특수 도구:
  • 지식 검색 도구(OCI GenAI Enterprise AI Agents 직접 벡터 저장소 검색)
  • 프레임 분석 도구(다중 모델 LLM)
  • 보고서 생성 도구
  • 평가 도구

비디오에 음성 오디오가 포함되어 있는 경우 OCI Speech가 해당 오디오를 전송하고 녹취록을 다운스트림 에이전트로 공급합니다. OCI 이벤트Oracle Cloud Infrastructure Functions는 이벤트 기반 인제스트를 제공하여 새로운 비디오가 업로드될 때 자동으로 프로세싱을 트리거하고, 프론트 엔드(예: Autonomous AI Database의 Oracle APEX)는 검토 및 구성을 위한 휴먼 인 루프 인터페이스를 제공합니다.

이 솔루션에는 다음이 포함됩니다.

  • 4개의 특수 도구(지식 검색, 프레임 분석, 보고서 생성, 평가)가 있는 에이전트 파이프라인으로, 각각 해당 작업에 가장 적합한 모델을 사용합니다.
  • 이벤트 기반 비디오 수집: OCI EventsOCI Object Storage에서 새로운 업로드를 감지하고, OCI Functions를 트리거하여 각각의 새로운 비디오에 대해 OCI GenAI Enterprise AI Agents 호스팅 애플리케이션을 호출합니다.
  • OCI GenAI Enterprise AI Agents 벡터 저장소 검색을 통한 RAG 기반 컨텍스트 보강.
  • OCI 생성형 AI를 통해 다양한 멀티모달 모델 및 LLM을 사용할 수 있습니다.
  • 음성 콘텐츠가 포함된 비디오의 경우 OCI Speech를 통한 오디오 전사 기능을 통해 요약 및 평가 도구에 대한 성적 증명 컨텍스트를 제공합니다.

구조

아키텍처는 자동화된 수집 및 통합관리 계층과 4개의 특수 도구가 포함된 에이전트 처리 파이프라인이라는 2개의 계층으로 구성됩니다.

각 도구는 고유한 기능(지식 검색, 프레임 이해, 보고서 합성 또는 기준 기반 평가)을 캡슐화하고 해당 기능에 가장 적합한 AI 모델을 사용합니다. OCI Speech를 통한 오디오 전사 기능은 비디오에 음성 콘텐츠가 포함된 경우 시각적 분석을 보완합니다.

다음 다이어그램은 솔루션의 논리적 구조를 보여줍니다.



agentic-video-analysis-arch-oracle.zip#GUID-82D7B400-2350-4103-8894-94E5D26AF1E5

워크플로우

엔드투엔드 워크플로우는 다음과 같이 진행됩니다.

  1. 비디오 수집: 비디오 파일이 OCI Object Storage에 업로드됩니다. OCI Object Storage 버킷에는 오브젝트 이벤트가 활성화되어 있으므로 각 업로드 시 이벤트가 자동으로 전송됩니다.
  2. 이벤트 기반 파이프라인 트리거: OCI Eventscom.oraclecloud.objectstorage.createobject 이벤트를 통해 새로운 비디오 업로드를 감지합니다. 이벤트 규칙은 비디오의 OCI 오브젝트 스토리지 참조(버킷 이름, 객체 이름, 네임스페이스)를 전달하여 백엔드의 REST API를 호출하는 OCI 함수를 트리거합니다.
  3. 프레임 추출: OCI GenAI Enterprise AI Agents에 배포된 Python 백엔드는 OCI SDK를 사용하여 OCI Object Storage에서 비디오를 다운로드한 다음 OpenCV를 사용하여 구성 가능한 간격으로 프레임을 추출하여 JPEG 이미지와 base64 인코딩 축소판을 생성합니다.
  4. 오디오 필사(조건부): 비디오에 오디오 트랙이 포함된 경우 OCI Speech는 자동 언어 감지 기능을 갖춘 Whisper 모델을 사용하여 음성 콘텐츠를 전사합니다. OCI Speech는 사전 오디오 추출 없이도 비디오 파일(MP4, MKV, WEBM)을 직접 사용할 수 있습니다. 필사는 프레임 분석 및 지식 검색과 병렬로 실행됩니다.
  5. 에이전트 파이프라인:
    1. 지식 검색 도구(조건부): 검색 증강 생성(RAG)이 사용으로 설정된 경우 분석 프롬프트가 OCI GenAI Enterprise AI Agents Vector Store Search API로 전송됩니다. 이 애플리케이션은 관리되는 벡터 저장소를 직접 쿼리하고, 인덱스화된 참조 문서에서 관련 조각 및 메타데이터를 검색하고, 해당 결과의 형식을 다운스트림 보고서 생성을 위한 RAG 컨텍스트로 지정합니다. 이 검색 단계는 보고서 생성 전에 분석 요청당 한 번씩 실행됩니다. 나중에 독립적으로 실행하거나 프레임 분석 및 오디오 필사와 병렬로 실행되도록 최적화할 수 있습니다.
    2. 프레임 분석 도구(병렬, 프레임당): 에이전트가 이미지 프레임 및 분석 프롬프트를 수신한 다음, OCI Generative AI에서 선택된 멀티모달 비전 모델을 사용하여 구조화된 관찰을 반환합니다. 파이프라인은 분석을 가속화하기 위해 동시에 프레임을 디스패치할 수 있습니다.
    3. 보고서 생성 도구: 모든 프레임을 분석한 후 보고서 생성 도구는 프레임 레벨 관찰, 오디오 기록(사용 가능한 경우) 및 컨텍스트의 전체 세트를 수신합니다. 텍스트-유사성 모델을 사용하여 종합적인 구조화된 보고서를 합성합니다. RAG가 사용으로 설정된 경우 지식 검색 도구의 참조 컨텍스트가 프롬프트에 주입되어 추가 참조 섹션이 포함된 컨텍스트 인식 보고서를 생성합니다.
    4. 평가 도구: 평가 도구는 지식 검색 도구에서 보고서, 프레임 레벨 관찰, 오디오 기록(사용 가능한 경우) 및 참조 컨텍스트를 수신합니다. 텍스트 합리화 모델을 사용하여 각 관찰을 참조 문서의 특정 기준에 명시적으로 매핑하고, 심각도, 준수 영역 및 우선순위가 지정된 권장 사항을 인용과 함께 나열하는 구조화된 평가 보고서를 생성합니다.
  6. 결과 지속성: 분석 출력은 자율운영 AI 데이터베이스에 저장됩니다.
  7. 검증: Oracle APEX와 같은 프런트엔드 애플리케이션에서 결과를 검토하고 검증할 수 있습니다.

구성요소

이 아키텍처는 다음과 같은 OCI 서비스, 구성 요소 및 기능을 사용합니다.

  • OCI 생성형 AI
    • 엔터프라이즈 AI 모델.
      • 프레임 분석을 위한 멀티모달 모델(예: Cohere Command A Vision, Google Gemini, Meta Llama 4)
      • Cohere Command A Reasoning과 같은 추론 모델은 요약 및 규정 준수/평가 보고서에 사용됩니다.
    • OCI GenAI Enterprise AI 에이전트
      • 벡터 저장소: 문서 지식 기반에 대한 관리형 수집, 조각화, 포함 및 검색의 경우입니다.
      • 호스팅 배포: 프레임 추출, 오디오 전사 통합관리, AI 에이전트 통합관리(병렬 프레임 분석 실행, 직접 AI 벡터 저장소 검색, 보고서 어셈블리) 등 전체 Python 파이프라인을 실행합니다.
  • OCI 음성

    자동 언어 감지 기능을 갖춘 Whisper 모델을 사용한 자동 음성 인식. 배치 전사용으로 비디오 파일(MP4, MKV, WEBM)을 직접 받아 시간 기록된 JSON 및 SRT 출력을 생성합니다.

  • Oracle Autonomous AI Database 26ai

    분석 보고서, 보고서 기록, 검증 상태, APEX 애플리케이션 상태 및 운영 분석을 위한 영구 스토리지 계층 역할을 합니다.

  • OCI 오브젝트 스토리지

    비디오 파일(카메라, SFTP(보안 파일 전송 프로토콜) 또는 수동 업로드)에 대한 랜딩 영역 역할을 합니다. 객체 이벤트는 버킷에서 사용으로 설정되므로 OCI 이벤트에 의해 업로드가 자동으로 감지됩니다. 선택적으로 참조 문서를 레코드/아카이브 소스로 저장합니다. 승인된 문서는 OCI GenAI Enterprise AI Agents Files API를 통해 업로드되고, 검색을 위해 OCI GenAI Enterprise AI Agents 벡터 저장소에 첨부됩니다.

  • OCI 이벤트

    OCI Object Storage에서 새로운 비디오 업로드를 감지하고 이벤트 규칙을 통해 OCI Functions를 트리거합니다. 실패한 배달에 대한 기본 제공 재시도 및 문자 사용 불능 처리를 제공합니다.

  • OCI 기능

    OCI Object Storage 이벤트 페이로드를 수신하고 OCI GenAI Enterprise AI Agents에서 백엔드의 REST API를 호출하는 경량 Python 함수입니다. 유휴 비용 없이 서버리스를 실행합니다.

  • Oracle Cloud Infrastructure Identity and Access Management

    OCI GenAI Enterprise AI Agents, OCI Speech, Autonomous AI Database, OCI Object Storage, OCI Events, OCI Functions, Enterprise OCI GenAI Enterprise AI Agents 호스팅 배포, Files API, Vector Store API 및 직접 벡터 저장소 검색을 포함한 모든 서비스 상호 작용을 승인합니다.

  • OCI GenAI Enterprise AI Agents 벡터 저장소 및 지식 검색

    OCI GenAI Enterprise AI Agents는 에이전트 애플리케이션 런타임 및 해당 검색 계층을 위한 관리형 플랫폼을 제공합니다. 규정 및 도메인 참조 문서는 파일 API를 통해 업로드되며, 프로젝트 범위 벡터 저장소에 첨부되고, 관리 서비스에 의해 인덱스화되고, 벡터 저장소 검색을 통해 직접 질의됩니다.

    런타임 시 Knowledge Retrieval Tool은 분석 프롬프트를 벡터 저장소 검색으로 보내고, 관련 청크, 소스 메타데이터 및 인용을 검색하고, 형식이 지정된 컨텍스트를 보고서 생성 및 평가 도구에 전달하여 기반 준수 매핑을 수행합니다. 이를 통해 시력 분석을 참조 텍스트와 분리하는 동시에 규제 인식 합성 및 기준 매핑을 사용할 수 있습니다.

권장사항

이 아키텍처를 구현할 때 모델 선택, 검색 품질, 프롬프트 설계, 프레임 추출, 전사, 이벤트 기반 수집 및 파이프라인 확장을 고려하십시오.

이 구조를 구현할 때는 다음 권장 사항을 고려하십시오.

  • 동영상 선택: 실제 평가 사례를 나타내는 비디오 목록을 선택합니다.
  • 비전 모델 선택: 여러 모델을 통해 동일한 비디오를 실행하여 가장 적합한 모델을 찾습니다.
  • RAG 문서 큐레이션: 도메인, 규제 세트 또는 고객 경계당 전용 OCI GenAI Enterprise AI Agents 벡터 저장소를 사용할 수 있습니다. 원본 파일의 미리보기/감사가 필요한 경우 소스 문서의 버전을 OCI Object Storage 또는 다른 제어 저장소로 유지합니다. 승인된 파일만 벡터 저장소에 연결하고, 속성으로 태그를 지정하고, 인덱싱을 기다리며, 프로덕션에서 사용으로 설정하기 전에 직접 벡터 저장소 검색을 통해 검색 품질을 검증합니다.
  • 프롬프트 엔지니어링: 관찰할 대상 및 추출할 정량 데이터에 대해 구체적으로 설명합니다. 반복 분석 작업에 대해 재사용 가능한 프롬프트 템플리트를 작성합니다.
  • 프레임 추출 튜닝: 느리게 변경되는 장면: 3-5초 간격. 동적 콘텐츠: 1초. 최대 프레임 상한값을 사용하여 비용을 제어합니다.
  • 오디오 전사: 속삭임 및 자동 언어 감지를 통해 OCI Speech를 사용할 수 있습니다. 속삭임은 전사 품질을 향상시킬 수 있습니다. 가능한 경우 프레임 분석과 병렬로 필사를 실행하여 엔드 투 엔드 처리 시간을 최소화합니다.
  • 이벤트 기반 수집: 업로드 버킷에서 객체 이벤트를 사용으로 설정하고 OCI 이벤트 규칙을 구성하여 새 업로드 시 OCI 함수를 트리거합니다. 이를 통해 폴링 지연을 없애고 실시간에 가까운 처리를 보장합니다. 오류 처리 및 경고를 위해 Oracle Cloud Infrastructure LoggingOracle Cloud Infrastructure Notifications를 사용합니다.
  • 파이프라인 확장: 순차적 에이전트 설계를 통해 OCI 컴퓨트의 Python 파이프라인 내에 도구(예: 추세 분석, 통지, 번역)를 간단히 추가할 수 있습니다.

고려사항

이 아키텍처에 대한 고가용성, 보안, 성능 및 엔터프라이즈 통합 고려 사항을 검토합니다.
  • 고가용성

    자율운영 AI 데이터베이스, OCI 생성형 AI, OCI Speech, OCI Events, OCI Functions, OCI GenAI Enterprise AI Agents 호스팅 배포, OCI GenAI Enterprise AI Agents 벡터 저장소는 내장된 내결함성 및 서비스 관리형 운영을 갖춘 관리형 서비스입니다.
  • 보안

    • 모든 API 통신은 HTTPS/TLS를 사용합니다. 자율운영 AI 데이터베이스는 보고서 지속성을 위해 전자 지갑 또는 TLS 연결을 통해 mTLS를 지원합니다. 엔터프라이즈 AI 에이전트 파일, 벡터 저장소, 응답 및 호스트된 배포 엔드포인트는 HTTPS를 통해 호출되며 프로덕션에서 OCI Identity and Access Management 및 리소스 주체 권한 부여를 사용해야 합니다.
    • 엔터프라이즈 AI 액세스, 파일 API, 벡터 저장소 API, 직접 벡터 저장소 검색, OCI Functions, OCI Object Storage, Autonomous AI DatabaseOCI Speech에 대한 최소 권한의 OCI Identity and Access Management 정책을 적용합니다. 동적 그룹 및 매칭 규칙을 사용하여 OCI Functions 및 호스팅된 배포에 OCI GenAI Enterprise AI Agents 엔드포인트를 호출하고 대상 프로젝트 범위 벡터 저장소에 액세스할 수 있는 권한을 부여합니다. 이후 파일 검색 기반 검색 모드가 사용으로 설정된 경우에만 응답 API 파일 검색 권한을 추가합니다.
    • 암호 관리를 위해 OCI VaultOCI Secret Management, 비디오/소스 문서 보존을 위한 OCI Object Storage 수명 주기 정책, 문서 수집, 삭제, 코퍼스 버전 지정을 위한 벡터 저장소 거버넌스 제어 등을 사용할 수 있습니다.
  • 성능

    • 병렬 프레임 분석은 백엔드에서 실행됩니다. 엔터프라이즈 AI 모델 비율 제한을 기반으로 동시성을 조정합니다.
    • 이벤트 기반 프로세싱은 비디오가 업로드될 때 자연스럽게 로드를 분산시킵니다. 대량 업로드 중 API 경합을 제어하려면 백엔드에서 동시성 제한을 구현합니다.
  • 엔터프라이즈 통합

    이 아키텍처는 이벤트 기반 수집을 위해 OCI EventsOCI Functions를 사용하며, 이는 OCI Object Storage 트리거 처리 파이프라인에 권장되는 패턴입니다. 여러 엔터프라이즈 시스템(예: SaaS 애플리케이션, B2B 워크플로우, 온프레미스 ERP)과의 통합이 필요한 배포의 경우 Oracle Integration을 이벤트 기반 트리거의 통합관리 계층 다운스트림으로 도입하여 시각적 통합 설계, 사전 구축된 애플리케이션 어댑터 및 엔터프라이즈급 감사 추적을 제공할 수 있습니다.

승인

  • 작성자: Mirjana Rakuljic, Cristina Granes, Ras Alungei
  • 기여자: Robert Lies