Modelli compatibili per l'importazione
Puoi importare modelli di linguaggio di grandi dimensioni open source e di terze parti da bucket di storage degli oggetti Hugging Face e OCI in OCI Generative AI. Dopo aver importato un modello, è possibile ospitarlo in un cluster AI dedicato, creare un endpoint e utilizzarlo nel servizio AI generativa.
-
I modelli importati non richiedono l'impegno di hosting minimo di 744 ore per unità che si applica quando si ospitano modelli pre-addestrati disponibili in OCI Generative AI su cluster AI dedicati.
-
L'utilizzo di questi modelli può essere soggetto a termini separati dai fornitori di terze parti applicabili e l'utente è responsabile della conformità a tali termini. Oracle declina qualsiasi garanzia, indennizzo e responsabilità derivante da o correlata a LLM open source o di terzi da Voi importati.
-
Per le forme hardware disponibili e i passi su come distribuire i modelli importati, vedere Forme unità hardware del cluster AI dedicate.
Architettura modello importata AI generativa OCI
Il servizio OCI Generative AI utilizza Open Model Engine (OME) per distribuire e gestire i modelli importati. OME funge da livello di orchestrazione tra la GPU e il runtime di inferenza.
Quando si distribuisce un modello importato, OME analizza il modello e lo associa al runtime più efficiente: vLLM (ottimizzato per throughput elevato) e SGLang (ottimizzato per prestazioni elevate). I motori runtime vLLM e SGLang eseguono i modelli sulle GPU.
Alcuni modelli sono fortemente ottimizzati per SGLang (come LLM su larga scala e quelli che richiedono RadixAttention per la memoria con contesto lungo), mentre altri hanno kernel di comunità migliori in vLLM (come i popolari LLM open-source e i modelli multimodali).
Modelli compatibili
- Alibaba Qwen
Presenta casi d'uso avanzati multilingue e multimodali.
- DeepSeek
Ottimizzato per la codifica, la matematica e il ragionamento complesso.
- Google Gemma
Progettato per l'elaborazione del linguaggio su vasta scala e per casi d'uso generici.
- Meta Llama
Modelli con GQA (Grouped Query Attention) avanzato per migliorare le prestazioni.
- Microsoft Phi
Modelli compatti ed efficienti per implementazioni scalabili.
- MiniMax
Modelli Mixture-of-Experts (MoE) efficienti ottimizzati per la codifica, il ragionamento complesso e flussi di lavoro lenti.
- Mistral
Include modelli di incorporamento e chat. Il modello di incorporamento è adatto per una gestione efficiente a lungo termine.
- Moonshot AI Kimi
Modelli text-to-text ottimizzati per la codifica a lungo raggio, flussi di lavoro lenti e complesse attività di progettazione del software.
- NVIDIA Nemotron
Modelli a peso aperto con dati e ricette di formazione pubblicati, adatti per la creazione di agenti AI specializzati.
- Whisper OpenAI
Modello audio-testo per carichi di lavoro di trascrizione multilingue e riconoscimento vocale automatico ad alto throughput.
- GptOss OpenAI
Modelli Mixture-of-Experts (MoE) a peso aperto per ragionamenti efficienti e movimentazione di grandi contesti.
- Z.ai GLM
Modelli di generazione di testo ottimizzati per la codifica a lungo raggio, flussi di lavoro lenti ed efficiente elaborazione di grandi contesti.