使用 OCI Generative AI 多模式模型和企业 AI Agents 分析视频

使用 AI 多模式模型处理视频文件,以根据公司的知识库分析和生成详细报告。

多模态大语言模型 (MLLM) 可以理解图像,还可以通过扩展来理解视频中的帧。

视频是一系列帧,每个帧都是多模态 LLM 可以分析的图像。以下参考架构利用此功能在 Oracle Cloud Infrastructure ( OCI ) 上构建通用批处理视频分析管道。视频将上载到 Oracle Cloud Infrastructure Object Storage ,由 Oracle Cloud Infrastructure Events 自动检测,并在 Oracle Cloud Infrastructure Compute 实例上进行处理,该实例将视频分解为帧,使用 Oracle Cloud Infrastructure Speech 录制任何语音音频,通过 AI 模型分析可视内容和音频内容,并将结果合成一致的报告。

四个专用工具构成了处理管道:
  • 知识检索工具( OCI GenAI Enterprise AI Agents 直接向量存储搜索)
  • 框架分析工具(多模式 LLM)
  • 报表生成工具
  • 评估工具

当视频包含语音音频时, OCI Speech 会将其转录并输入下游代理。OCI EventsOracle Cloud Infrastructure Functions 提供事件驱动的摄取,在上传新视频时自动触发处理,而前端(例如 Autonomous AI Database 上的 Oracle APEX)则提供人工环路界面供您查看和配置。

此解决方案包括:

  • 具有四个专用工具(知识检索,帧分析,报告生成,评估)的代理管道,每个都使用最适合其任务的模型。
  • 事件驱动的视频摄取: OCI Events 检测 OCI Object Storage 中的新上载,并触发 OCI Functions ,为每个新视频调用 OCI GenAI Enterprise AI Agents 托管应用。
  • 通过 OCI GenAI Enterprise AI Agents 向量存储搜索增强基于 RAG 的上下文。
  • 通过 OCI Generative AI 提供多种多模式模型和 LLM。
  • 通过 OCI Speech 对包含语音内容的视频进行音频转录,为摘要和评估工具提供记录上下文。

体系结构

该架构由两层组成:一个自动摄取和编排层和一个具有四个专用工具的代理处理管道。

每个工具都包含不同的功能(知识检索、框架理解、报告综合或基于标准的评估),并使用最适合该功能的 AI 模型。当视频包含语音内容时,通过 OCI Speech 进行音频转录可补充可视化分析。

下图显示了解决方案的逻辑体系结构:



agent-video-analysis-arch-oracle.zip#GUID-82D7B400-2350-4103-8894-94E5D26AF1E5

工作流

端到端工作流继续如下:

  1. 视频摄取:视频文件将上载到 OCI 对象存储OCI 对象存储存储桶启用了对象事件,因此每次上载都会自动发出事件。
  2. 事件驱动的管道触发器OCI Events 通过 com.oraclecloud.objectstorage.createobject 事件检测新的视频上载。事件规则触发 OCI 函数,该规则调用通过视频的 OCI 对象存储引用(存储桶名称、对象名称、名称空间)的后端 REST API。
  3. 框架提取:部署在 OCI GenAI Enterprise AI Agents 上的 Python 后端使用 OCI SDK 从 OCI Object Storage 下载视频,然后使用 OpenCV 以可配置的间隔提取帧,生成 JPEG 映像和 base64 编码的缩略图。
  4. 音频转录(条件):如果视频包含音频轨道,则 OCI Speech 将使用带有自动语言检测的 Whisper 模型来转录语音内容。OCI Speech 直接接受视频文件(MP4、MKV、WEBM),而无需事先提取音频。转录与帧分析和知识检索并行运行。
  5. 代理管道:
    1. 知识检索工具(条件):如果启用了检索增强生成 (RAG),则分析提示将发送到 OCI GenAI Enterprise AI Agents 向量存储搜索 API。该应用程序直接查询受管向量存储,从索引参考文档中检索相关块和元数据,并将这些结果格式化为 RAG 上下文,以生成下游报告。此检索步骤在生成报表之前针对每个分析请求运行一次;以后可以对其进行优化以独立运行,也可以与帧分析和音频转录并行运行。
    2. 框架分析工具(并行,每帧):代理接收图像框架和分析提示,然后使用 OCI Generative AI 中的选定多模式视觉模型返回结构化观测。管道可以同时分派帧以加速分析。
    3. 报告生成工具:分析所有帧后,报告生成工具将接收一组完整的帧级别观察、音频记录(如果可用)和上下文。它使用文本原因模型来综合全面的结构化报告。启用 RAG 时,知识检索工具中的引用上下文将注入到提示中,生成带有附加引用节的上下文感知报告。
    4. 评估工具:评估工具从知识检索工具接收报告、帧级别观察、音频记录(如果可用)以及参考上下文。它使用文本原因模型生成一个结构化的评估报告,该报告将每个观察结果显式映射到参考文档中的特定标准,列出具有严重性,符合区域的调查结果,以及带有引用的优先建议。
  6. 结果持久性:分析输出将保存到 Autonomous AI Database
  7. 验证:可以在前端应用程序(例如 Oracle APEX )中查看和验证结果。

组件

此体系结构使用以下 OCI 服务、组件和功能:

  • OCI 生成式 AI
    • 企业 AI 模型。
      • 多模式模型(例如 Cohere Command A Vision、Google Gemini、Meta Llama 4)用于帧分析。
      • 推理模型(如 Cohere Command A Reasoning)用于汇总和合规性/评估报告。
    • OCI GenAI 企业 AI 代理
      • 矢量存储:用于文档知识库的托管摄取、分块、嵌入和检索。
      • 托管部署:运行完整的 Python 管道:帧提取、音频转录编排、AI 代理编排(并行帧分析执行、直接 AI 向量存储搜索检索和报告汇编)。
  • OCI 语音

    使用带有自动语言检测的 Whisper 模型进行自动语音识别。直接接受视频文件 (MP4,MKV,WEBM) 进行批量转录,生成带有时间戳的 JSON 和 SRT 输出。

  • Oracle Autonomous AI Database 26ai

    充当分析报告、报告历史记录、验证状态、APEX 应用状态和运营分析的持久性存储层。

  • OCI 对象存储

    充当视频文件的着陆区(来自相机、安全文件传输协议 (SFTP) 或手动上载)。对象事件在存储桶上处于启用状态,因此 OCI 事件会自动检测上载。(可选)将参考文档存储为记录源/归档;批准的文档通过 OCI GenAI Enterprise AI Agents 文件 API 上载并附加到 OCI GenAI Enterprise AI Agents 向量存储以供检索。

  • OCI 事件

    检测 OCI 对象存储中的新视频上载,并通过事件规则触发 OCI 函数。为失败的交付提供内置的重试和死信处理。

  • OCI 功能

    轻量级 Python 函数,接收 OCI Object Storage 事件有效负载,并在 OCI GenAI Enterprise AI Agents 上调用后端的 REST API。无服务器运行,无空闲成本。

  • Oracle Cloud Infrastructure 身份和访问管理

    授权所有服务交互,包括 OCI GenAI Enterprise AI AgentsOCI SpeechAutonomous AI DatabaseOCI Object StorageOCI EventsOCI Functions 、Enterprise OCI GenAI Enterprise AI Agents 托管的部署、Files API、Vector Store API 和直接向量存储搜索。

  • OCI GenAI Enterprise AI Agents 向量存储和知识检索

    OCI GenAI Enterprise AI Agents 为代理应用运行时及其检索层提供托管平台。条例和域参考文档通过 Files API 上载,附加到项目范围的向量存储,由托管服务编制索引,并直接通过向量存储搜索进行查询。

    在运行时,知识检索工具将分析提示发送到向量存储搜索,检索相关块、源元数据和引用,并将格式化的上下文传递到报告生成和评估工具,以实现接地合规性映射。这使视觉分析与参考文本隔离,同时实现法规感知的合成和标准映射。

推荐

实施此架构时,请考虑模型选择、检索质量、提示设计、帧提取、转录、事件驱动的摄取和管道扩展。

实施此体系结构时,请考虑以下建议。

  • 视频选择:选择要评估的真实案例的视频列表。
  • Vision model selection(视觉模型选择):通过多个模型运行相同的视频,以找到最合适的视频。
  • RAG 文档管理:按域、法规集或客户边界使用专用的 OCI GenAI Enterprise AI Agents 向量存储。需要预览/审计原始文件时,在 OCI Object Storage 或其他受控存储库中保留源文档版本。仅将批准的文件附加到向量存储,使用属性标记它们,等待索引编制,以及使用直接向量存储搜索验证检索质量,然后再将其启用到生产环境。
  • 快速工程:具体了解要观察的内容以及要提取的定量数据。为循环分析任务构建可重用的提示模板。
  • 帧提取优化:缓慢变化的场景:3-5 秒间隔。动态内容:1 秒使用最大帧数上限控制成本。
  • 音频转录:OCI Speech 与 Whisper 和自动语言检测结合使用。耳语提示可以提高转录质量。使用帧分析并行运行转录,尽可能缩短端到端的处理时间。
  • 事件驱动的摄取:在上载存储桶上启用对象事件,并配置 OCI 事件规则以在新上载时触发 OCI 函数。这消除了轮询延迟,并确保近乎实时的处理。使用 Oracle Cloud Infrastructure LoggingOracle Cloud Infrastructure Notifications 进行错误处理和预警。
  • Pipeline 扩展:通过顺序代理设计,可以在 OCI Compute 上的 Python 管道中添加工具(例如趋势分析、通知、翻译)。

注意事项

查看此架构的高可用性、安全性、性能和企业集成注意事项。
  • 高可用性

    Autonomous AI DatabaseOCI Generative AIOCI SpeechOCI EventsOCI FunctionsOCI GenAI Enterprise AI Agents 托管部署和 OCI GenAI Enterprise AI Agents 向量存储是具有内置容错能力和服务管理操作的托管服务。
  • 安全

    • 所有 API 通信都使用 HTTPS/TLS。Autonomous AI Database 通过 wallet 或 TLS 连接支持 mTLS,以实现报告持久性。Enterprise AI Agents 文件、向量存储、响应和托管部署端点通过 HTTPS 调用,必须在生产环境中使用 OCI Identity and Access Management 和资源主用户授权。
    • 对企业 AI 访问、文件 API、向量存储 API、直接向量存储搜索、 OCI FunctionsOCI Object StorageAutonomous AI DatabaseOCI Speech 应用最低权限的 OCI Identity and Access Management 策略。使用动态组和匹配规则对 OCI Functions 和托管部署进行授权,以调用 OCI GenAI Enterprise AI Agents 端点并访问目标项目范围的向量存储。仅当启用了将来基于文件搜索的检索模式时,才添加响应 API 文件搜索权限。
    • 使用 OCI VaultOCI Secret Management 进行密钥管理、使用 OCI Object Storage 生命周期策略来保留视频/源文档,以及使用向量存储监管控制来摄取、删除和语料库版本控制。
  • 性能

    • 并行帧分析在后端运行。根据企业 AI 模型的费率限制调整并发性。
    • 事件驱动的处理会在上载视频时自然分配加载。要在大容量上载期间控制 API 争用,请在后端实施并发限制。
  • 企业级集成

    此体系结构使用 OCI EventsOCI Functions 进行事件驱动的摄取,这是 OCI Object Storage 触发的处理管道的建议模式。对于需要与多个企业系统(例如 SaaS 应用、B2B 工作流、内部部署 ERP)集成的部署,可以将 Oracle Integration 引入事件驱动触发器的下游编排层,从而提供可视化集成设计、预构建的应用适配器和企业级审计线索。

确认

  • 作者Mirjana Rakuljic, Cristina Granes, Ras Alungei
  • 贡献者Robert Lies