使用 OCI Generative AI 多模式模型和企业 AI Agents 分析视频
多模态大语言模型 (MLLM) 可以理解图像,还可以通过扩展来理解视频中的帧。
视频是一系列帧,每个帧都是多模态 LLM 可以分析的图像。以下参考架构利用此功能在 Oracle Cloud Infrastructure ( OCI ) 上构建通用批处理视频分析管道。视频将上载到 Oracle Cloud Infrastructure Object Storage ,由 Oracle Cloud Infrastructure Events 自动检测,并在 Oracle Cloud Infrastructure Compute 实例上进行处理,该实例将视频分解为帧,使用 Oracle Cloud Infrastructure Speech 录制任何语音音频,通过 AI 模型分析可视内容和音频内容,并将结果合成一致的报告。
- 知识检索工具( OCI GenAI Enterprise AI Agents 直接向量存储搜索)
- 框架分析工具(多模式 LLM)
- 报表生成工具
- 评估工具
当视频包含语音音频时, OCI Speech 会将其转录并输入下游代理。OCI Events 和 Oracle Cloud Infrastructure Functions 提供事件驱动的摄取,在上传新视频时自动触发处理,而前端(例如 Autonomous AI Database 上的 Oracle APEX)则提供人工环路界面供您查看和配置。
此解决方案包括:
- 具有四个专用工具(知识检索,帧分析,报告生成,评估)的代理管道,每个都使用最适合其任务的模型。
- 事件驱动的视频摄取: OCI Events 检测 OCI Object Storage 中的新上载,并触发 OCI Functions ,为每个新视频调用 OCI GenAI Enterprise AI Agents 托管应用。
- 通过 OCI GenAI Enterprise AI Agents 向量存储搜索增强基于 RAG 的上下文。
- 通过 OCI Generative AI 提供多种多模式模型和 LLM。
- 通过 OCI Speech 对包含语音内容的视频进行音频转录,为摘要和评估工具提供记录上下文。
体系结构
每个工具都包含不同的功能(知识检索、框架理解、报告综合或基于标准的评估),并使用最适合该功能的 AI 模型。当视频包含语音内容时,通过 OCI Speech 进行音频转录可补充可视化分析。
下图显示了解决方案的逻辑体系结构:
agent-video-analysis-arch-oracle.zip#GUID-82D7B400-2350-4103-8894-94E5D26AF1E5
工作流
端到端工作流继续如下:
- 视频摄取:视频文件将上载到 OCI 对象存储。OCI 对象存储存储桶启用了对象事件,因此每次上载都会自动发出事件。
- 事件驱动的管道触发器: OCI Events 通过
com.oraclecloud.objectstorage.createobject事件检测新的视频上载。事件规则触发 OCI 函数,该规则调用通过视频的 OCI 对象存储引用(存储桶名称、对象名称、名称空间)的后端 REST API。 - 框架提取:部署在 OCI GenAI Enterprise AI Agents 上的 Python 后端使用 OCI SDK 从 OCI Object Storage 下载视频,然后使用 OpenCV 以可配置的间隔提取帧,生成 JPEG 映像和 base64 编码的缩略图。
- 音频转录(条件):如果视频包含音频轨道,则 OCI Speech 将使用带有自动语言检测的 Whisper 模型来转录语音内容。OCI Speech 直接接受视频文件(MP4、MKV、WEBM),而无需事先提取音频。转录与帧分析和知识检索并行运行。
- 代理管道:
- 知识检索工具(条件):如果启用了检索增强生成 (RAG),则分析提示将发送到 OCI GenAI Enterprise AI Agents 向量存储搜索 API。该应用程序直接查询受管向量存储,从索引参考文档中检索相关块和元数据,并将这些结果格式化为 RAG 上下文,以生成下游报告。此检索步骤在生成报表之前针对每个分析请求运行一次;以后可以对其进行优化以独立运行,也可以与帧分析和音频转录并行运行。
- 框架分析工具(并行,每帧):代理接收图像框架和分析提示,然后使用 OCI Generative AI 中的选定多模式视觉模型返回结构化观测。管道可以同时分派帧以加速分析。
- 报告生成工具:分析所有帧后,报告生成工具将接收一组完整的帧级别观察、音频记录(如果可用)和上下文。它使用文本原因模型来综合全面的结构化报告。启用 RAG 时,知识检索工具中的引用上下文将注入到提示中,生成带有附加引用节的上下文感知报告。
- 评估工具:评估工具从知识检索工具接收报告、帧级别观察、音频记录(如果可用)以及参考上下文。它使用文本原因模型生成一个结构化的评估报告,该报告将每个观察结果显式映射到参考文档中的特定标准,列出具有严重性,符合区域的调查结果,以及带有引用的优先建议。
- 结果持久性:分析输出将保存到 Autonomous AI Database 。
- 验证:可以在前端应用程序(例如 Oracle APEX )中查看和验证结果。
组件
此体系结构使用以下 OCI 服务、组件和功能:
- OCI 生成式 AI
- 企业 AI 模型。
- 多模式模型(例如 Cohere Command A Vision、Google Gemini、Meta Llama 4)用于帧分析。
- 推理模型(如 Cohere Command A Reasoning)用于汇总和合规性/评估报告。
- OCI GenAI 企业 AI 代理
- 矢量存储:用于文档知识库的托管摄取、分块、嵌入和检索。
- 托管部署:运行完整的 Python 管道:帧提取、音频转录编排、AI 代理编排(并行帧分析执行、直接 AI 向量存储搜索检索和报告汇编)。
- 企业 AI 模型。
- OCI 语音
使用带有自动语言检测的 Whisper 模型进行自动语音识别。直接接受视频文件 (MP4,MKV,WEBM) 进行批量转录,生成带有时间戳的 JSON 和 SRT 输出。
- Oracle Autonomous AI Database 26ai
充当分析报告、报告历史记录、验证状态、APEX 应用状态和运营分析的持久性存储层。
- OCI 对象存储
充当视频文件的着陆区(来自相机、安全文件传输协议 (SFTP) 或手动上载)。对象事件在存储桶上处于启用状态,因此 OCI 事件会自动检测上载。(可选)将参考文档存储为记录源/归档;批准的文档通过 OCI GenAI Enterprise AI Agents 文件 API 上载并附加到 OCI GenAI Enterprise AI Agents 向量存储以供检索。
- OCI 事件
检测 OCI 对象存储中的新视频上载,并通过事件规则触发 OCI 函数。为失败的交付提供内置的重试和死信处理。
- OCI 功能
轻量级 Python 函数,接收 OCI Object Storage 事件有效负载,并在 OCI GenAI Enterprise AI Agents 上调用后端的 REST API。无服务器运行,无空闲成本。
- Oracle Cloud Infrastructure 身份和访问管理
授权所有服务交互,包括 OCI GenAI Enterprise AI Agents 、 OCI Speech 、 Autonomous AI Database 、 OCI Object Storage 、 OCI Events 、 OCI Functions 、Enterprise OCI GenAI Enterprise AI Agents 托管的部署、Files API、Vector Store API 和直接向量存储搜索。
-
OCI GenAI Enterprise AI Agents 向量存储和知识检索
OCI GenAI Enterprise AI Agents 为代理应用运行时及其检索层提供托管平台。条例和域参考文档通过 Files API 上载,附加到项目范围的向量存储,由托管服务编制索引,并直接通过向量存储搜索进行查询。
在运行时,知识检索工具将分析提示发送到向量存储搜索,检索相关块、源元数据和引用,并将格式化的上下文传递到报告生成和评估工具,以实现接地合规性映射。这使视觉分析与参考文本隔离,同时实现法规感知的合成和标准映射。
推荐
实施此体系结构时,请考虑以下建议。
- 视频选择:选择要评估的真实案例的视频列表。
- Vision model selection(视觉模型选择):通过多个模型运行相同的视频,以找到最合适的视频。
- RAG 文档管理:按域、法规集或客户边界使用专用的 OCI GenAI Enterprise AI Agents 向量存储。需要预览/审计原始文件时,在 OCI Object Storage 或其他受控存储库中保留源文档版本。仅将批准的文件附加到向量存储,使用属性标记它们,等待索引编制,以及使用直接向量存储搜索验证检索质量,然后再将其启用到生产环境。
- 快速工程:具体了解要观察的内容以及要提取的定量数据。为循环分析任务构建可重用的提示模板。
- 帧提取优化:缓慢变化的场景:3-5 秒间隔。动态内容:1 秒使用最大帧数上限控制成本。
- 音频转录:将 OCI Speech 与 Whisper 和自动语言检测结合使用。耳语提示可以提高转录质量。使用帧分析并行运行转录,尽可能缩短端到端的处理时间。
- 事件驱动的摄取:在上载存储桶上启用对象事件,并配置 OCI 事件规则以在新上载时触发 OCI 函数。这消除了轮询延迟,并确保近乎实时的处理。使用 Oracle Cloud Infrastructure Logging 和 Oracle Cloud Infrastructure Notifications 进行错误处理和预警。
- Pipeline 扩展:通过顺序代理设计,可以在 OCI Compute 上的 Python 管道中添加工具(例如趋势分析、通知、翻译)。
注意事项
-
高可用性
Autonomous AI Database 、 OCI Generative AI 、 OCI Speech 、 OCI Events 、 OCI Functions 、 OCI GenAI Enterprise AI Agents 托管部署和 OCI GenAI Enterprise AI Agents 向量存储是具有内置容错能力和服务管理操作的托管服务。 -
安全
- 所有 API 通信都使用 HTTPS/TLS。Autonomous AI Database 通过 wallet 或 TLS 连接支持 mTLS,以实现报告持久性。Enterprise AI Agents 文件、向量存储、响应和托管部署端点通过 HTTPS 调用,必须在生产环境中使用 OCI Identity and Access Management 和资源主用户授权。
- 对企业 AI 访问、文件 API、向量存储 API、直接向量存储搜索、 OCI Functions 、 OCI Object Storage 、 Autonomous AI Database 和 OCI Speech 应用最低权限的 OCI Identity and Access Management 策略。使用动态组和匹配规则对 OCI Functions 和托管部署进行授权,以调用 OCI GenAI Enterprise AI Agents 端点并访问目标项目范围的向量存储。仅当启用了将来基于文件搜索的检索模式时,才添加响应 API 文件搜索权限。
- 使用 OCI Vault 和 OCI Secret Management 进行密钥管理、使用 OCI Object Storage 生命周期策略来保留视频/源文档,以及使用向量存储监管控制来摄取、删除和语料库版本控制。
-
性能
- 并行帧分析在后端运行。根据企业 AI 模型的费率限制调整并发性。
- 事件驱动的处理会在上载视频时自然分配加载。要在大容量上载期间控制 API 争用,请在后端实施并发限制。
-
企业级集成
此体系结构使用 OCI Events 和 OCI Functions 进行事件驱动的摄取,这是 OCI Object Storage 触发的处理管道的建议模式。对于需要与多个企业系统(例如 SaaS 应用、B2B 工作流、内部部署 ERP)集成的部署,可以将 Oracle Integration 引入事件驱动触发器的下游编排层,从而提供可视化集成设计、预构建的应用适配器和企业级审计线索。
