使用 OCI Generative AI 多模型模型和 Enterprise AI Agents 分析影片

使用 AI 多模型模型處理影片檔案,根據公司的知識庫分析和產生詳細報告。

多模型大型語言模型 (MLLM) 可透過擴充功能瞭解影像,以及影片的影格。

視訊是一系列影格,每個影格都是多模 LLM 可以分析的影像。下列參考架構利用此功能在 Oracle Cloud Infrastructure ( OCI) 上建置一般用途的批次視訊分析管線。影片會上傳至 Oracle Cloud Infrastructure Object Storage (由 Oracle Cloud Infrastructure Events 自動偵測),並在 Oracle Cloud Infrastructure Compute 執行處理上處理,這些執行處理會將它們分解為框架、使用 Oracle Cloud Infrastructure Speech 轉錄任何口說的音訊、透過 AI 模型分析視覺和音訊內容,並將發現項目合成一致的報表。

四個特殊工具組成處理管道:
  • 知識檢索工具 ( OCI GenAI Enterprise AI Agents 直接向量儲存搜尋)
  • 框架分析工具 (多節點 LLM)
  • 報表產生工具
  • 評估工具

當影片包含口語音訊時, OCI Speech 會將其轉錄,並將記錄饋送至下游代理程式。OCI EventsOracle Cloud Infrastructure Functions 提供事件導向的擷取,在上傳新影片時自動觸發處理,而前端 (例如, Autonomous AI Database 上的 Oracle APEX) 則提供用於複查和組態的人工迴圈介面。

此解決方案包括:

  • 具有四個特殊工具 (知識擷取、框架分析、報表產生、評估) 的專員業務進程,每個工具皆使用最適合其任務的模型。
  • 事件導向的影片擷取: OCI Events 會偵測 OCI Object Storage 中的新上傳,並觸發 OCI Functions ,為每個新影片呼叫 OCI GenAI Enterprise AI Agents 託管應用程式。
  • 透過 OCI GenAI Enterprise AI Agents 向量儲存搜尋,增強以 RAG 為基礎的內容。
  • 透過 OCI Generative AI 提供多個多模型模型和 LLM。
  • 透過 OCI Speech 進行音訊轉錄,以瞭解含口語內容的影片,並提供摘要和評估工具的成績單內容。

架構

此架構由兩層組成:自動擷取和協調層,以及具有四個專業工具的代理處理管線。

每個工具都封裝了不同的功能 (知識檢索、框架理解、報告合成或標準型評估),並使用最適合該功能的 AI 模型。透過 OCI Speech 的音訊轉錄,可在影片包含口語內容時補足視覺分析。

下圖顯示解決方案的邏輯架構:



agent-video-analysis-arch-oracle.zip#GUID-82D7B400-2350-4103-8894-94E5D26AF1E5

Workflow

端對端工作流程的處理方式如下:

  1. 影片擷取:影片檔案會上傳至 OCI Object StorageOCI Object Storage 儲存桶已啟用物件事件,因此每次上傳都會自動發出事件。
  2. 事件導向管線觸發程式OCI 事件會透過 com.oraclecloud.objectstorage.createobject 事件偵測新的視訊上傳。事件規則會觸發 OCI 函數,此函數會呼叫後端的 REST API 來傳遞視訊的 OCI 物件儲存參照 (儲存桶名稱、物件名稱、命名空間)。
  3. 框架擷取:部署在 OCI GenAI Enterprise AI Agents 上的 Python 後端使用 OCI SDK 從 OCI Object Storage 下載影片,然後使用 OpenCV 產生可設定的間隔擷取框架,產生 JPEG 影像和 base64 編碼縮圖。
  4. 音訊轉錄 (條件性) :如果影片包含音訊軌, OCI Speech 會使用 Whisper 模型自動偵測語言,來轉錄口語內容。OCI Speech 可直接接受視訊檔案 (MP4、MKV、WEBM),而不需要事先擷取音訊。轉譯會與框架分析和知識擷取平行執行。
  5. 代理程式管線:
    1. 知識檢索工具 (條件性) :如果已啟用檢索增強生成 (RAG),分析提示會傳送至 OCI GenAI Enterprise AI Agents Vector Store Search API。應用程式會直接查詢受管理的向量儲存區、從已編列索引的參考文件中擷取相關的區塊和中繼資料,並將這些結果格式化為 RAG 內容以產生下游報表。此擷取步驟會在產生報表之前,針對每個分析要求執行一次;稍後可進行最佳化,以獨立執行或與框架分析和音訊轉譯平行執行。
    2. 框架分析工具 (平行,每個框架) :代理程式會接收影像框架和分析提示,然後使用 OCI Generative AI 中選取的多模型視覺模型來傳回結構化觀察。業務進程可以同時分配框架,以加速分析。
    3. 報表產生工具:分析所有框架之後,「報表產生工具」會收到一組完整的框架層次監測、音訊記錄 (可用時) 以及相關資訊環境。它使用文字原因模型來合成全面的結構化報表。啟用 RAG 時,「知識擷取工具」中的參照環境定義會插入提示中,產生具有其他「參照」區段的內容感知報表。
    4. 評估工具:「評估工具」會從「知識擷取工具」接收報表、框架層次監測、音訊記錄 (可用時) 以及參照相關資訊環境。它使用文字調理模型產生結構化評估報告,可明確地將每個觀察與參照文件中的特定準則對應、列出嚴重性的發現項目、符合的區域,以及含引用的優先建議。
  6. 結果持續性:分析輸出會儲存至 Autonomous AI Database
  7. 驗證:您可以在前端應用程式中複查和驗證結果,例如 Oracle APEX

元件

此架構使用下列 OCI 服務、元件和功能:

  • OCI 生成式 AI
    • 企業 AI 模型。
      • 多模型 (例如,Cohere Command A Vision、Google Gemini、Meta Llama 4) 用於框架分析。
      • 推理模型 (例如 Cohere Command A Reasoning) 是用於摘要和合規性 / 評估報表。
    • OCI GenAI Enterprise AI Agents
      • 向量儲存區:適用於文件知識庫的受管理擷取、分區、內嵌及擷取。
      • 託管部署:執行完整的 Python 管線:框架擷取、音訊轉錄協調、AI 代理程式協調 (平行框架分析執行、直接 AI 向量儲存搜尋擷取和報告組合)。
  • OCI 語音

    使用 Whisper 模型自動偵測語言,自動辨識語音。直接接受批次轉譯的視訊檔案 (MP4、MKV、WEBM),以產生時戳 JSON 和 SRT 輸出。

  • Oracle Autonomous AI Database 26ai

    可作為分析報表、報表歷史記錄、驗證狀態、APEX 應用程式狀態及作業分析的永久儲存層。

  • OCI Object Storage

    可作為視訊檔案 (從相機、安全檔案傳輸通訊協定 (SFTP) 或手動上傳) 的登陸區。儲存桶上會啟用物件事件,讓 OCI 事件自動偵測上傳。選擇性地將參考文件儲存為記錄來源 / 封存;核准的文件會透過 OCI GenAI Enterprise AI Agents 檔案 API 上傳,並附加至 OCI GenAI Enterprise AI Agents 向量儲存以供擷取。

  • OCI 事件

    偵測 OCI Object Storage 中的新視訊上傳,並透過事件規則觸發 OCI Functions 。針對失敗的傳遞提供內建的重試和死信處理。

  • OCI Functions

    接收 OCI Object Storage 事件有效負載的輕量型 Python 函數,並在 OCI GenAI Enterprise AI Agents 上叫用後端的 REST API。無需閒置成本即可執行無伺服器。

  • Oracle Cloud Infrastructure Identity and Access Management

    授權所有服務互動,包括 OCI GenAI Enterprise AI AgentsOCI SpeechAutonomous AI DatabaseOCI Object StorageOCI EventsOCI Functions 、Enterprise OCI GenAI Enterprise AI Agents 託管部署、檔案 API、向量儲存 API 和直接向量儲存搜尋。

  • OCI GenAI Enterprise AI Agents 向量儲存和知識擷取

    OCI GenAI Enterprise AI Agents 為代理應用程式執行時期及其擷取層提供受管理的平台。法規和領域參考文件是透過 Files API 上傳,附加至專案範圍的向量儲存區,由託管服務編製索引,並直接透過向量儲存區搜尋查詢。

    在執行階段,Knowledge Retrieval Tool 會傳送分析提示至向量儲存搜尋、擷取相關區塊、來源中繼資料及引用,並將格式化內容傳遞至「報告產生」與「評估」工具,以進行不必要的規範對應。這樣可使視覺分析與參考文字隔離,同時啟用法規感知合成與準則對應。

建議

導入此架構時,請考慮選擇模型、擷取品質、提示設計、擷取框架、轉譯、事件導向擷取及管線擴充。

實作此架構時,請考量下列建議。

  • 影片選擇:選取真實案例的影片代表清單以進行評估。
  • Vision 模型選擇:透過多個模型執行相同影片以找出最佳適配。
  • RAG 文件策劃:每個網域、法規集或客戶邊界使用專用的 OCI GenAI Enterprise AI Agents 向量儲存。當需要預覽 / 稽核原始檔案時,請將來源文件版本保留在 OCI Object Storage 或其他受控制的儲存庫中。僅將已核准的檔案附加至向量儲存區、使用屬性標記檔案、等待編製索引,以及使用直接向量儲存區搜尋驗證擷取品質,然後再於生產中啟用這些檔案。
  • 提示工程:針對要觀察的內容和要擷取的量化資料。為週期性分析任務建立可重複使用的提示範本。
  • 框架擷取調整:緩慢的場景:間隔為 3-5 秒。動態內容:1 秒使用最大影格上限控制成本。
  • 音訊轉錄:搭配 Whisper 與自動語言偵測使用 OCI Speech 。Whisper 提示可提升轉錄品質。盡可能使用框架分析並行執行轉錄,將端對端處理時間降到最低。
  • 事件導向擷取:在上傳儲存桶上啟用物件事件,並設定 OCI 事件規則,以觸發新上傳的 OCI 函數。這可避免輪詢延遲,並確保近乎即時的處理。使用 Oracle Cloud Infrastructure LoggingOracle Cloud Infrastructure Notifications 進行錯誤處理和警示。
  • 業務進程擴充:循序代理程式設計可讓您在 OCI Compute 的 Python 業務進程中新增工具 (例如趨勢分析、通知、翻譯)。

注意事項

檢閱此架構的高可用性、安全性、效能及企業整合考量。
  • 高可用性

    Autonomous AI DatabaseOCI Generative AIOCI SpeechOCI EventsOCI FunctionsOCI GenAI Enterprise AI Agents 託管部署,以及 OCI GenAI Enterprise AI Agents 向量儲存區是具有內建容錯和服務管理作業的託管服務。
  • 安全

    • 所有 API 通訊都使用 HTTPS/TLS。Autonomous AI Database 支援透過公事包或 TLS 連線進行 mTLS,以持續報告。企業 AI 代理程式檔案、向量儲存區、回應和代管的部署端點會透過 HTTPS 呼叫,且必須在生產中使用 OCI Identity and Access Management 和資源主要授權。
    • 套用最低權限的 OCI Identity and Access Management 原則,以存取企業 AI、檔案 API、向量儲存 API、直接向量儲存搜尋、 OCI FunctionsOCI Object StorageAutonomous AI DatabaseOCI Speech 。使用動態群組和比對規則來授權 OCI Functions 和代管部署,以呼叫 OCI GenAI Enterprise AI Agents 端點並存取目標專案作用領域向量儲存區。只有在啟用未來檔案搜尋式擷取模式時,才新增回應 API 檔案搜尋權限。
    • 使用 OCI VaultOCI 加密密碼管理進行加密密碼管理、使用 OCI Object Storage 生命週期原則進行視訊 / 來源文件保留,以及使用向量存放區治理控制進行文件擷取、刪除和 Corpus 版本控制。
  • 效能

    • 平行框架分析會在後端執行。根據企業 AI 模型速率限制調整並行。
    • 事件導向處理會在上傳影片時,自然地分配負載。若要在大量上傳期間控制 API 競爭,請在後端實作並行限制。
  • 企業整合

    此架構使用 OCI EventsOCI Functions 進行事件導向擷取,這是 OCI Object Storage 觸發處理管線的建議模式。對於需要與多個企業系統整合的部署 (例如 SaaS 應用程式、B2B 工作流程、內部部署 ERP),Oracle Integration 可以導入為事件驅動觸發程式下游的協調層,提供視覺化整合設計、預先建置的應用程式轉接器,以及企業級稽核軌跡。

確認

  • 作者Mirjana Rakuljic, Cristina Granes, Ras Alungei
  • 貢獻者Robert Lies