Analizza i video utilizzando OCI Generative AI modelli multimodali e agenti AI aziendali

Elabora i file video utilizzando modelli multimodali AI per analizzare e generare report dettagliati in base alla knowledge base della tua azienda.

Multimodal Large Language Models (MLLM) è in grado di comprendere le immagini e, per estensione, i fotogrammi dei video.

Un video è una sequenza di fotogrammi, e ogni fotogramma è un'immagine che un LLM multimodale può analizzare. La seguente architettura di riferimento sfrutta questa capacità per creare una pipeline di analisi video in batch generica su Oracle Cloud Infrastructure (OCI). I video vengono caricati in Oracle Cloud Infrastructure Object Storage, rilevati automaticamente da Oracle Cloud Infrastructure Events ed elaborati su un'istanza di Oracle Cloud Infrastructure Compute che li decompone in frame, trascrive qualsiasi audio parlato utilizzando Oracle Cloud Infrastructure Speech, analizza i contenuti visivi e audio tramite modelli AI e sintetizza i risultati in report coerenti.

Quattro strumenti specializzati formano la pipeline di elaborazione:
  • Knowledge Retrieval Tool (ricerca diretta nella memoria di vettore degli agenti AI aziendali OCI GenAI)
  • Strumento di analisi frame (LLM multimodale)
  • Strumento di generazione report
  • Strumento di valutazione

Quando il video contiene l'audio parlato, OCI Speech lo trascrive e invia la trascrizione agli agenti a valle. OCI Events e Oracle Cloud Infrastructure Functions forniscono un'inclusione basata sugli eventi, attivando l'elaborazione automaticamente quando vengono caricati nuovi video, mentre un front end (ad esempio, Oracle APEX su Autonomous AI Database) fornisce l'interfaccia human-in-the-loop per la revisione e la configurazione.

Questa soluzione include:

  • Pipeline Agentic con quattro strumenti specializzati (Knowledge Retrieval, Frame Analysis, Report Generation, Evaluation), ciascuno utilizzando il modello più adatto al proprio compito.
  • Video ingestion basato sugli eventi: OCI Events rileva nuovi caricamenti in OCI Object Storage e attiva OCI Functions, che richiama l'applicazione ospitata OCI GenAI Enterprise AI Agents per ogni nuovo video.
  • Aumento del contesto basato su RAG attraverso la ricerca nella memoria di vettore degli agenti AI aziendali OCI GenAI.
  • Più modelli multimodali e LLM disponibili tramite l'AI generativa OCI.
  • Trascrizione audio tramite OCI Speech per video con contenuti parlati, fornendo il contesto di trascrizione agli strumenti di riepilogo e valutazione.

Architettura

L'architettura è composta da due livelli: un livello di ingestione e orchestrazione automatizzate e una pipeline di elaborazione identica con quattro strumenti specializzati.

Ogni strumento incapsula una capacità distinta (recupero delle conoscenze, comprensione dei frame, sintesi dei report o valutazione basata su criteri) e utilizza il modello AI più adatto a tale capacità. La trascrizione audio tramite OCI Speech completa l'analisi visiva quando i video contengono contenuti parlati.

Il seguente diagramma mostra l'architettura logica della soluzione:



Agentic-video-analisi-arch-oracle.zip#GUID-82D7B400-2350-4103-8894-94E5D26AF1E5

Flusso di lavoro

Il workflow end-to-end procede come indicato di seguito.

  1. Ingestione video: i file video vengono caricati nello storage degli oggetti OCI. Per il bucket di OCI Object Storage sono abilitati gli eventi oggetto, pertanto ogni caricamento emette automaticamente un evento.
  2. Attivazione pipeline basata sugli eventi: gli eventi OCI rilevano nuovi caricamenti video tramite eventi com.oraclecloud.objectstorage.createobject. Una regola Eventi attiva le funzioni OCI, che richiamano l'API REST del backend passando il riferimento del video allo storage degli oggetti OCI (nome bucket, nome oggetto, spazio di nomi).
  3. Estrazione frame: il back-end Python distribuito su OCI GenAI Enterprise AI Agents scarica il video da OCI Object Storage utilizzando l'SDK OCI, quindi estrae i frame a intervalli configurabili utilizzando OpenCV, producendo immagini JPEG e miniature con codifica base64.
  4. Trascrizione audio (condizionale): se il video contiene una traccia audio, OCI Speech trascrive il contenuto parlato utilizzando i modelli Whisper con rilevamento automatico della lingua. OCI Speech accetta i file video direttamente (MP4, MKV, WEBM) senza richiedere l'estrazione audio precedente. La trascrizione viene eseguita in parallelo con l'analisi del frame e il recupero della conoscenza.
  5. Pipeline Agentic:
    1. Knowledge Retrieval Tool (condizionale): se la retrieval augmented generation (RAG) è abilitata, il prompt di analisi viene inviato all'API di ricerca dell'area di memorizzazione dei vettori OCI GenAI Enterprise AI Agents. L'applicazione esegue direttamente query sulla memoria di vettore gestita, recupera i chunk e i metadati pertinenti dai documenti di riferimento indicizzati e formatta tali risultati come contesto RAG per la generazione di report a valle. Questo passo di recupero viene eseguito una volta per richiesta di analisi prima della generazione del report; può essere ottimizzato in seguito per essere eseguito in modo indipendente o in parallelo con l'analisi dei fotogrammi e la trascrizione audio.
    2. Strumento di analisi del frame (parallelo, per frame): l'agente riceve un frame immagine e un prompt di analisi, quindi restituisce osservazioni strutturate utilizzando il modello di visione multimodale selezionato in AI generativa OCI. La pipeline può inviare i frame contemporaneamente per accelerare l'analisi.
    3. Strumento di generazione report: dopo l'analisi di tutti i frame, lo strumento di generazione report riceve il set completo di osservazioni a livello di frame, la trascrizione audio (se disponibile) e il contesto. Utilizza un modello di ragionamento testuale per sintetizzare un report strutturato completo. Quando RAG è abilitato, il contesto di riferimento dello strumento di recupero Knowledge viene inserito nel prompt, producendo un report dipendente dal contesto con una sezione Riferimenti aggiuntiva.
    4. Strumento di valutazione: lo strumento di valutazione riceve il report, le osservazioni a livello di frame, la trascrizione audio (se disponibile) e il contesto di riferimento da Knowledge Retrieval Tool. Utilizzando un modello di ragionamento testuale, produce un rapporto di valutazione strutturato che mappa esplicitamente ogni osservazione a criteri specifici dai documenti di riferimento, elencando i risultati con gravità, aree conformi e raccomandazioni prioritarie con citazioni.
  6. Result Persistentence: gli output dell'analisi vengono salvati in Autonomous AI Database.
  7. Convalida: i risultati possono essere rivisti e convalidati nell'applicazione front-end, ad esempio Oracle APEX.

Componenti

Questa architettura utilizza i servizi, i componenti e le funzionalità OCI riportati di seguito.

  • AI generativa OCI
    • Modelli AI aziendali.
      • Modelli multimodali (ad esempio, Cohere Command A Vision, Google Gemini, Meta Llama 4) per l'analisi dei frame.
      • Un modello di ragionamento, ad esempio Cohere Command A Reasoning, viene utilizzato per report sintetici e di conformità/valutazione.
    • Agenti AI aziendali OCI GenAI
      • Vector store: per l'inclusione, il chunking, l'incorporamento e il recupero gestiti per la knowledge base del documento.
      • Distribuzione in hosting: esegue la pipeline Python completa: estrazione dei frame, orchestrazione della trascrizione audio, orchestrazione dell'agente AI (esecuzione dell'analisi dei frame paralleli, recupero della ricerca nella memoria di vettore AI diretta e assemblaggio dei report).
  • OCI Speech

    Riconoscimento vocale automatico utilizzando i modelli Whisper con rilevamento automatico del linguaggio. Accetta i file video direttamente (MP4, MKV, WEBM) per la trascrizione in batch, producendo output JSON e SRT con timestamp.

  • Oracle Autonomous AI Database 26ai

    Serve come livello di storage persistente per i report di analisi, la cronologia dei report, lo stato di convalida, lo stato dell'applicazione APEX e gli analytics operativi.

  • Memorizzazione degli oggetti OCI

    Serve come zona di destinazione per i file video (da telecamere, protocollo di trasferimento file sicuro (SFTP) o caricamento manuale). Gli eventi oggetto vengono abilitati nel bucket in modo che i caricamenti vengano rilevati automaticamente da eventi OCI. Facoltativamente, memorizza i documenti di riferimento come origine del record o dell'archivio; i documenti approvati vengono caricati tramite l'API dei file OCI GenAI Enterprise AI Agents e allegati alla memoria di vettore OCI GenAI Enterprise AI Agents per il recupero.

  • Eventi OCI

    Rileva i nuovi caricamenti video nello storage degli oggetti OCI e attiva le funzioni OCI tramite regole evento. Fornisce i nuovi tentativi integrati e la gestione delle lettere morte per le consegne non riuscite.

  • Funzioni OCI

    Funzione Python leggera che riceve il payload dell'evento OCI Object Storage e richiama l'API REST del backend sugli agenti AI aziendali OCI GenAI. Esegue serverless senza costi di inattività.

  • Oracle Cloud Infrastructure Identity and Access Management

    Autorizza tutte le interazioni dei servizi, tra cui OCI GenAI Enterprise AI Agents, OCI Speech, Autonomous AI Database, OCI Object Storage, OCI Events, OCI Functions, Enterprise OCI GenAI Enterprise AI Agents implementazioni in hosting, Files API, Vector Store API e ricerca diretta nella memoria di vettore.

  • Agenti AI aziendali OCI GenAI e recupero di conoscenze

    OCI GenAI Enterprise AI Agents fornisce la piattaforma gestita per il runtime delle applicazioni e il suo livello di recupero. I documenti di regolamento e di riferimento del dominio vengono caricati tramite l'API Files, allegati a una memoria di vettore con ambito di progetto, indicizzati dal servizio gestito e sottoposti a query direttamente tramite la ricerca nella memoria di vettore.

    In fase di esecuzione, Knowledge Retrieval Tool invia il prompt di analisi alla ricerca nella memoria di vettore, recupera i chunk, i metadati di origine e le citazioni pertinenti e passa il contesto formattato agli strumenti di generazione e valutazione dei report per il mapping di conformità basato. Ciò mantiene l'analisi della visione isolata dal testo di riferimento, consentendo al contempo la sintesi e la mappatura dei criteri conformi alle normative.

Suggerimenti

Prendi in considerazione la selezione del modello, la qualità del recupero, la progettazione tempestiva, l'estrazione dei frame, la trascrizione, l'inclusione basata sugli eventi e l'estensione della pipeline durante l'implementazione di questa architettura.

Quando si implementa questa architettura, prendere in considerazione i suggerimenti riportati di seguito.

  • Selezione video: selezionare un elenco di video rappresentativi di casi reali da valutare.
  • Selezione del modello Vision: esegui lo stesso video attraverso più modelli per trovare la soluzione migliore.
  • Cura dei documenti RAG: utilizza una memoria di vettore OCI GenAI Enterprise AI Agents dedicata per dominio, set di normative o limite del cliente. Mantieni i documenti di origine con controllo delle versioni in Storage degli oggetti OCI o in un altro repository controllato quando è richiesta l'anteprima o l'audit dei file originali. Collegare solo i file approvati alla memoria di vettore, contrassegnarli con gli attributi, attendere l'indicizzazione e convalidare la qualità del recupero con la ricerca diretta della memoria di vettore prima di abilitarli in produzione.
  • Prompt engineering: sii specifico su cosa osservare e quali dati quantitativi estrarre. Crea modelli di prompt riutilizzabili per task di analisi ricorrenti.
  • Ottimizzazione dell'estrazione del frammento: scene in continua evoluzione: intervalli di 3-5 secondi. Contenuto dinamico: 1 s. Utilizzare il limite massimo di frame per controllare i costi.
  • Trascrizione audio: utilizza OCI Speech con Whisper e rilevamento automatico della lingua. Whisper prompt può migliorare la qualità della trascrizione. Esegui la trascrizione in parallelo con l'analisi dei frame, dove possibile, per ridurre al minimo i tempi di elaborazione end-to-end.
  • Inclusione basata sugli eventi: abilita gli eventi oggetto nel bucket di caricamento e configura una regola Eventi OCI per attivare una Funzioni OCI nei nuovi caricamenti. Ciò elimina i ritardi del polling e garantisce un'elaborazione quasi in tempo reale. Utilizza Oracle Cloud Infrastructure Logging e Oracle Cloud Infrastructure Notifications per la gestione e l'invio di avvisi.
  • Estensione pipeline: la progettazione sequenziale dell'agente semplifica l'aggiunta di strumenti (ad esempio Analisi delle tendenze, Notifica, Traduzione) nella pipeline Python in OCI Compute.

Considerazioni

Esamina considerazioni su alta disponibilità, sicurezza, prestazioni e integrazione aziendale per questa architettura.
  • Alta disponibilità

    Autonomous AI Database, OCI Generative AI, OCI Speech, OCI Events, OCI Functions, OCI GenAI Enterprise AI Agents implementazioni in hosting e OCI GenAI Enterprise AI Agents vector store sono servizi gestiti con tolleranza agli errori integrata e operazioni gestite dai servizi.
  • Sicurezza

    • Tutte le comunicazioni API utilizzano HTTPS/TLS. Autonomous AI Database supporta mTLS tramite un wallet o connessioni TLS per la persistenza dei report. I file degli agenti AI di livello Enterprise, le aree di memorizzazione vettoriali, le risposte e gli endpoint di distribuzione hosted vengono richiamati tramite HTTPS e devono utilizzare OCI Identity and Access Management e l'autorizzazione principale delle risorse in produzione.
    • Applica criteri di OCI Identity and Access Management con privilegi minimi per l'accesso AI aziendale, l'API dei file, l'API della memoria di vettore, la ricerca diretta della memoria di vettore, le funzioni OCI, lo storage degli oggetti OCI, il database AI autonomo e la voce OCI. Utilizzare i gruppi dinamici e le regole di corrispondenza per autorizzare le funzioni OCI e le distribuzioni in hosting a richiamare gli endpoint OCI GenAI Enterprise AI Agents e accedere alla memoria di vettore con ambito progetto di destinazione. Consente di aggiungere le autorizzazioni di ricerca file API risposte solo se è abilitata una modalità di recupero futura basata sulla ricerca di file.
    • Utilizza OCI Vault e OCI Secret Management per la gestione dei segreti, i criteri del ciclo di vita dello storage degli oggetti OCI per la conservazione di documenti video/di origine e i controlli di governance di vector-store per l'inclusione, l'eliminazione e il controllo delle versioni corpus dei documenti.
  • Prestazioni

    • L'analisi del frame parallelo viene eseguita nel back-end. Regola la concorrenza in base AI limiti di frequenza dei modelli AI aziendali.
    • L'elaborazione basata sugli eventi distribuisce il carico in modo naturale man mano che i video vengono caricati. Per controllare i conflitti di API durante i caricamenti di volumi elevati, implementa i limiti di concorrenza nel back-end.
  • Integrazione aziendale

    Questa architettura utilizza gli eventi OCI e le funzioni OCI per l'inclusione basata sugli eventi, che è il pattern consigliato per le pipeline di elaborazione attivate dallo storage degli oggetti OCI. Per le distribuzioni che richiedono l'integrazione con più sistemi aziendali (ad esempio, applicazioni SaaS, flussi di lavoro B2B, ERP on-premise), Oracle Integration può essere introdotto come livello di orchestrazione a valle del trigger basato sugli eventi, fornendo progettazione visiva dell'integrazione, adattatori predefiniti delle applicazioni e audit trail di livello aziendale.

Conferme

  • Autori: Mirjana Rakuljic, Cristina Granes, Ras Alungei
  • Collaboratori: Robert Lies