Videos mit multimodalen OCI Generative AI-Modellen und Enterprise AI Agents analysieren
Multimodale Large Language Models (MLLMs) können Bilder und Frames aus Videos verstehen.
Ein Video ist eine Sequenz von Frames, und jeder Frame ist ein Bild, das ein multimodales LLM analysieren kann. Die folgende Referenzarchitektur nutzt diese Funktion, um eine allgemeine Batchvideoanalyse-Pipeline auf Oracle Cloud Infrastructure (OCI) zu erstellen. Videos werden in Oracle Cloud Infrastructure Object Storage hochgeladen, automatisch von Oracle Cloud Infrastructure Events erkannt und auf einer Oracle Cloud Infrastructure Compute-Instanz verarbeitet, die sie in Frames zerlegt, gesprochene Audiodateien mit Oracle Cloud Infrastructure Speech transkribiert, den visuellen und Audioinhalt über KI-Modelle analysiert und die Ergebnisse in kohärente Berichte synthetisiert.
- Knowledge Retrieval Tool (OCI GenAI Enterprise AI Agents, direkte Vektorspeichersuche)
- Rahmenanalysetool (multimodales LLM)
- Berichtserstellungstool
- Evaluierungstool
Wenn das Video gesprochenes Audio enthält, transkribiert OCI Speech es und gibt das Transkript an die Downstream-Agents weiter. OCI-Ereignisse und Oracle Cloud Infrastructure Functions bieten eine ereignisgesteuerte Aufnahme, die automatisch die Verarbeitung auslöst, wenn neue Videos hochgeladen werden, während ein Frontend (z.B. Oracle APEX auf Autonomous AI Database) die Human-in-the-Loop-Schnittstelle zur Prüfung und Konfiguration bereitstellt.
Diese Lösung umfasst:
- Agentische Pipeline mit vier spezialisierten Tools (Knowledge Retrieval, Frame Analysis, Report Generation, Evaluation), die jeweils das für ihre Aufgabe am besten geeignete Modell verwenden.
- Ereignisgesteuerte Videoaufnahme: OCI Events erkennt neue Uploads in OCI Object Storage und löst eine OCI Functions aus, die für jedes neue Video die gehostete Anwendung OCI GenAI Enterprise AI Agents aufruft.
- RAG-basierte Kontexterweiterung durch OCI GenAI Enterprise AI Agents Vektorspeichersuche.
- Mehrere multimodale Modelle und LLMs über OCI Generative AI verfügbar.
- Audiotranskription über OCI Speech für Videos mit gesprochenem Inhalt, die Transkriptkontext für die Übersichts- und Evaluierungstools bereitstellen.
Architektur
Jedes Tool kapselt eine eindeutige Funktion (Wissensabruf, Rahmenverständnis, Berichtssynthese oder kriterienbasierte Bewertung) und verwendet das KI-Modell, das für diese Funktion am besten geeignet ist. Audio-Transkription über OCI Speech ergänzt die visuelle Analyse, wenn Videos gesprochenen Inhalt enthalten.
Das folgende Diagramm zeigt die logische Architektur der Lösung:
agentic-video-analysis-arch-oracle.zip#GUID-82D7B400-2350-4103-8894-94E5D26AF1E5
Workflow
Der End-to-End-Workflow läuft wie folgt ab:
- Videoaufnahme: Videodateien werden in OCI Object Storage hochgeladen. Für den OCI Object Storage-Bucket sind Objektereignisse aktiviert, sodass jeder Upload automatisch ein Ereignis ausgibt.
- Ereignisgesteuerter Pipelinetrigger: OCI-Ereignisse erkennen neue Videouploads über
com.oraclecloud.objectstorage.createobject-Ereignisse. Eine Ereignisregel löst OCI Functions aus, das die REST-API des Backend aufruft, die die OCI Object Storage-Referenz des Videos übergibt (Bucket-Name, Objektname, Namespace). - Frame-Extraktion: Das auf OCI GenAI Enterprise AI Agents bereitgestellte Python-Backend lädt das Video mit dem OCI-SDK aus OCI Object Storage herunter und extrahiert Frames in konfigurierbaren Intervallen mit OpenCV. Dabei werden JPEG-Images und base64-codierte Thumbnails erstellt.
- Audiotranskription (bedingt): Wenn das Video einen Audiospur enthält, transkribiert OCI Speech den gesprochenen Inhalt mit Whisper-Modellen mit automatischer Spracherkennung. OCI Speech akzeptiert Videodateien direkt (MP4, MKV, WEBM), ohne dass eine vorherige Audioextraktion erforderlich ist. Die Transkription läuft parallel zu Frame-Analyse und Wissensabruf.
- Agentische Pipeline:
- Knowledge Retrieval Tool (bedingt): Wenn die Retrieval Augmented Generation (RAG) aktiviert ist, wird der Analyse-Prompt an die Vector Store Search API von OCI GenAI Enterprise AI Agents gesendet. Die Anwendung fragt direkt den verwalteten Vektorspeicher ab, ruft relevante Blöcke und Metadaten aus indizierten Referenzdokumenten ab und formatiert diese Ergebnisse als RAG-Kontext für die Generierung nachgelagerter Berichte. Dieser Abrufschritt wird einmal pro Analyseanforderung vor der Berichtsgenerierung ausgeführt. Er kann später optimiert werden, um unabhängig oder parallel mit Frame-Analyse und Audiotranskription auszuführen.
- Frame Analysis Tool (parallel, pro Schritt): Der Agent empfängt einen Imageframe und einen Analyse-Prompt und gibt dann strukturierte Beobachtungen mit dem ausgewählten multimodalen Vision-Modell in OCI Generative AI zurück. Die Pipeline kann Frames gleichzeitig versenden, um die Analyse zu beschleunigen.
- Berichtsgenerierungstool: Nachdem alle Schritte analysiert wurden, erhält das Berichtsgenerierungstool den vollständigen Satz von Beobachtungen auf Schrittebene, das Audiotranskript (sofern verfügbar) und den Kontext. Es verwendet ein textbasiertes Modell, um einen umfassenden strukturierten Bericht zu synthetisieren. Wenn RAG aktiviert ist, wird der Referenzkontext aus dem Knowledge Retrieval Tool in die Eingabeaufforderung injiziert, wodurch ein kontextbezogener Bericht mit einem zusätzlichen Abschnitt "Referenzen" erstellt wird.
- Bewertungstool: Das Evaluierungstool empfängt den Bericht, Beobachtungen auf Schrittebene, das Audiotranskript (sofern verfügbar) und den Referenzkontext aus dem Knowledge Retrieval Tool. Anhand eines Textbegründungsmodells erstellt es einen strukturierten Bewertungsbericht, der jede Beobachtung explizit bestimmten Kriterien aus den Referenzdokumenten zuordnet, Befunde mit Schweregrad auflistet, Bereiche anpasst und Empfehlungen mit Zitaten priorisiert.
- Ergebnispersistenz: Die Analyseausgaben werden in Autonome KI-Datenbank gespeichert.
- Validierung: Die Ergebnisse können in der Frontend-Anwendung, wie Oracle APEX, geprüft und validiert werden.
Komponenten
Diese Architektur verwendet die folgenden OCI-Services, -Komponenten und -Funktionen:
- OCI Generative AI
- KI-Modelle für Unternehmen.
- Multimodale Modelle (z.B. Cohere Command A Vision, Google Gemini, Meta Llama 4) für die Frame-Analyse.
- Ein Argumentationsmodell, z. B. Cohere Command A Reasoning, wird für Übersichts- und Compliance-/Evaluierungsberichte verwendet.
- OCI GenAI KI-Agenten für Unternehmen
- Vektorspeicher: Für die verwaltete Aufnahme, das Chunking, die Einbettung und den Abruf für die Wissensdatenbank des Dokuments.
- Gehostetes Deployment: Führt die vollständige Python-Pipeline aus: Frameextraktion, Orchestrierung der Audiotranskription, AI-Agent-Orchestrierung (Parallelframeanalyseausführung, direkter Abruf der AI-Vektorspeichersuche und Berichtsassemblierung).
- KI-Modelle für Unternehmen.
- OCI Speech
Automatische Spracherkennung mit Whisper-Modellen mit automatischer Spracherkennung. Akzeptiert Videodateien direkt (MP4, MKV, WEBM) für die Batch-Transkription und erzeugt einen mit Zeitstempel versehenen JSON- und SRT-Ausgang.
- Oracle Autonomous AI Database 26ai
Dient als persistente Speicherebene für Analyseberichte, Berichtshistorie, Validierungsstatus, APEX-Anwendungsstatus und Betriebsanalysen.
- OCI Object Storage
Dient als Landing Zone für Videodateien (von Kameras, Secure File Transfer Protocol (SFTP) oder manuelles Hochladen). Objektereignisse werden im Bucket aktiviert, sodass Uploads automatisch von OCI-Ereignissen erkannt werden. Speichert optional Referenzdokumente als Quelle des Datensatzes/Archivs. Genehmigte Dokumente werden über die OCI GenAI Enterprise AI Agents-Dateien-API hochgeladen und zum Abrufen an den Vektorspeicher OCI GenAI Enterprise AI Agents angehängt.
- OCI-Ereignisse
Ermittelt neue Videouploads in OCI Object Storage und löst OCI Functions über Ereignisregeln aus. Bietet integrierte Wiederholungs- und Dead-Letter-Behandlung für nicht erfolgreiche Lieferungen.
- OCI Functions
Leichte Python-Funktion, die die OCI Object Storage-Ereignis-Payload empfängt und die REST-API des Backends auf OCI GenAI Enterprise AI Agents aufruft. Wird serverlos ohne Leerlaufkosten ausgeführt.
- Oracle Cloud Infrastructure Identity and Access Management
Autorisiert alle Serviceinteraktionen, einschließlich OCI GenAI Enterprise AI Agents, OCI Speech, Autonomous AI Database, OCI Object Storage, OCI Events, OCI Functions, Enterprise OCI GenAI Enterprise AI Agents gehostete Deployments, Files API, Vector Store API und direkte Vektorspeichersuche.
-
OCI GenAI Enterprise AI Agents Vektorspeicher und Wissensabruf
OCI GenAI Enterprise AI Agents stellt die verwaltete Plattform für die Laufzeit der Agent-Anwendung und deren Abrufebene bereit. Regulierungs- und Domainreferenzdokumente werden über die Files-API hochgeladen, an einen projektbezogenen Vektorspeicher angehängt, vom verwalteten Service indiziert und direkt über die Vektorspeichersuche abgefragt.
Zur Laufzeit sendet das Knowledge Retrieval Tool den Analyse-Prompt an die Vektorspeichersuche, ruft relevante Blöcke, Quellmetadaten und Zitate ab und übergibt den formatierten Kontext an die Berichtsgenerierungs- und Evaluierungstools für die geerdete Compliancezuordnung. Dadurch wird die Sichtanalyse vom Referenztext isoliert und gleichzeitig eine regelungsbewusste Synthese und Kriterienzuordnung ermöglicht.
Empfehlungen
Berücksichtigen Sie bei der Implementierung dieser Architektur die folgenden Empfehlungen.
- Videoauswahl: Wählen Sie eine Liste von Videos aus, die für reale Fälle zur Bewertung repräsentativ sind.
- Vision-Modellauswahl: Führen Sie dasselbe Video über mehrere Modelle aus, um die beste Anpassung zu finden.
- RAG-Dokumentkuratierung: Verwenden Sie einen dedizierten OCI GenAI Enterprise AI Agents-Vektorspeicher pro Domain, Regulierungsset oder Kundengrenze. Quelldokumente in OCI Object Storage oder einem anderen kontrollierten Repository versionieren lassen, wenn eine Vorschau/Prüfung der ursprünglichen Dateien erforderlich ist. Hängen Sie nur genehmigte Dateien an den Vektorspeicher an, taggen Sie sie mit Attributen, warten Sie auf die Indexierung, und validieren Sie die Abrufqualität mit der direkten Vektorspeichersuche, bevor Sie sie in der Produktion aktivieren.
- Prompt-Engineering: Geben Sie an, was zu beobachten ist und welche quantitativen Daten extrahiert werden sollen. Erstellen Sie wiederverwendbare Prompt-Vorlagen für wiederkehrende Analyseaufgaben.
- Frame-Extraktionsoptimierung: Langsam wechselnde Szenen: 3-5-S-Intervalle. Dynamischer Inhalt: 1 s. Verwenden Sie die maximale Rahmenkappe, um die Kosten zu kontrollieren.
- Audiotranskription: Verwenden Sie OCI Speech mit Whisper und automatischer Spracherkennung. Flüstern kann die Transkriptionsqualität verbessern. Führen Sie die Transkription nach Möglichkeit parallel zur Rahmenanalyse aus, um die End-to-End-Verarbeitungszeit zu minimieren.
- Ereignisgesteuerte Aufnahme: Aktivieren Sie Objektereignisse im Upload-Bucket, und konfigurieren Sie eine OCI-Ereignisregel, um bei neuen Uploads eine OCI Functions auszulösen. Dadurch entfallen Polling-Verzögerungen und wird nahezu in Echtzeit verarbeitet. Verwenden Sie Oracle Cloud Infrastructure Logging und Oracle Cloud Infrastructure Notifications für Fehlerbehandlung und Alerting.
- Pipelineerweiterung: Das sequenzielle Agent-Design erleichtert das Hinzufügen von Tools (z.B. Trendanalyse, Benachrichtigung, Übersetzung) in der Python-Pipeline auf OCI Compute.
Hinweise
-
High Availability
Autonomous AI Database, OCI Generative AI, OCI Speech, OCI Events, OCI Functions, gehostete Deployments von OCI GenAI Enterprise AI Agents und Vektorspeicher von OCI GenAI Enterprise AI Agents sind verwaltete Services mit integrierter Fehlertoleranz und serviceverwalteten Vorgängen. -
Sicherheit
- Alle API-Kommunikationen verwenden HTTPS/TLS. Autonome KI-Datenbank unterstützt mTLS über ein Wallet oder TLS-Verbindungen für Berichtspersistenz. Enterprise AI-Agents-Dateien, Vektorspeicher, Antworten und gehostete Deployment-Endpunkte werden über HTTPS aufgerufen und müssen OCI Identity and Access Management und ressourcenorientierte Autorisierung in der Produktion verwenden.
- Wenden Sie OCI Identity and Access Management-Policys mit den geringsten Berechtigungen für den KI-Zugriff auf Unternehmen, für die Datei-API, die Vektorspeicher-API, die direkte Vektorspeichersuche, OCI Functions, OCI Object Storage, Autonomous AI Database und OCI Speech an. Verwenden Sie dynamische Gruppen und Vergleichsregeln, um OCI Functions und gehostete Deployments zu autorisieren, um OCI GenAI Enterprise AI Agents-Endpunkte aufzurufen und auf den projektbezogenen Vektorspeicher des Ziels zuzugreifen. Suchberechtigungen für die API-Datei für Antworten nur hinzufügen, wenn ein zukünftiger dateisuchbasierter Abrufmodus aktiviert ist.
- Verwenden Sie OCI Vault und OCI Secret Management für das Secrets-Management, OCI Object Storage-Lebenszyklus-Policys für die Aufbewahrung von Videos/Quelldokumenten und Governance-Steuerelemente für die Dokumentaufnahme, das Löschen und die Korpusversionierung.
-
Performance
- Die parallele Frame-Analyse erfolgt im Backend. Passen Sie die Nebenläufigkeit basierend auf den Ratenlimits von Enterprise AI Models an.
- Ereignisgesteuerte Verarbeitung verteilt die Last natürlich, wenn Videos hochgeladen werden. Um API-Konflikte bei Uploads mit hohem Volumen zu kontrollieren, implementieren Sie im Backend Nebenläufigkeitslimits.
-
Unternehmensintegration
Diese Architektur verwendet OCI-Ereignisse und OCI Functions für die ereignisgesteuerte Aufnahme. Dies ist das empfohlene Muster für OCI Object Storage-ausgelöste Verarbeitungspipelines. Bei Deployments, die eine Integration mit mehreren Unternehmenssystemen erfordern (z.B. SaaS-Anwendungen, B2B-Workflows, On-Premises-ERPs), kann Oracle Integration als Orchestrierungsschicht nach dem ereignisgesteuerten Trigger eingeführt werden, die ein visuelles Integrationsdesign, vordefinierte Anwendungsadapter und Audittrails der Unternehmensklasse bietet.
