Modelos compatíveis para importação
Você pode importar grandes modelos de linguagem de código aberto e de terceiros de Hugging Face e buckets do OCI Object Storage para a OCI Generative AI. Depois de importar um modelo, você pode hospedá-lo em um cluster de IA dedicado, criar um ponto final e usá-lo no serviço Generative AI.
-
Os modelos importados não exigem o compromisso mínimo de hospedagem de 744 horas por unidade que se aplica quando você hospeda modelos pré-treinados disponíveis na OCI Generative AI em clusters de IA dedicados.
-
Seu uso desses modelos pode estar sujeito a termos separados dos fornecedores terceirizados aplicáveis, e você é responsável por sua conformidade com tais termos. A Oracle se isenta de todas as garantias, indenizações e responsabilidades decorrentes ou relacionadas a quaisquer LLMs de código aberto ou de terceiros que você importar.
-
Para obter formas de hardware disponíveis e etapas sobre como implantar os modelos importados, consulte Formas de Unidade de Hardware de Cluster de IA Dedicado.
Arquitetura de Modelo Importada da OCI Generative AI
O serviço OCI Generative AI usa o Open Model Engine (OME) para implementar e gerenciar modelos importados. O OME atua como a camada de orquestração entre a GPU e o runtime de inferência.
Quando você implanta um modelo importado, o OME analisa o modelo e o combina com o runtime mais eficiente: vLLM (otimizado para alto throughput) e SGLang (otimizado para alto desempenho). Os mecanismos de runtime vLLM e SGLang executam os modelos nas GPUs.
Alguns modelos são altamente otimizados para SGLang (como LLMs de larga escala e aqueles que exigem RadixAttention para memória de contexto longo), enquanto outros têm melhores kernels da comunidade em vLLM (como LLMs de código aberto populares e modelos multimodais).
Modelos compatíveis
- Alibaba Qwen
Apresenta casos de uso multilíngues e multimodais avançados.
- DeepSeek
Otimizado para codificação, matemática e raciocínio complexo.
- Google Gemma
Desenvolvido para amplo processamento de linguagem e casos de uso de uso de uso geral.
- Meta Llama
Modelos com GQA (Agruped Query Attention) aprimorado para melhorar o desempenho.
- Microsoft Phi
Modelos compactos e eficientes para implementações escaláveis.
- MiniMax
Modelos eficientes de Mistura de Especialistas (MoE) otimizados para codificação, raciocínio complexo e fluxos de trabalho agênticos.
- Mistral
Inclui modelos de incorporação e chat. O modelo de incorporação é adequado para um manuseio eficiente de longo contexto.
- Moonshot AI Kimi
Modelos de texto para texto otimizados para codificação de longa duração, fluxos de trabalho agênticos e tarefas complexas de engenharia de software.
- NVIDIA Nemotron
Modelos de peso aberto com dados e receitas de treinamento publicados, adequados para a criação de agentes de IA especializados.
- Sussurro OpenAI
Modelo de áudio para texto para transcrição multilíngue e cargas de trabalho de reconhecimento automático de fala de alto rendimento.
- GptOs OpenAI
Modelos de Mixture-of-Experts (MoE) de peso aberto para raciocínio eficiente e manuseio de grande contexto.
- Z.ai GLM
Modelos de geração de texto otimizados para codificação de longa duração, fluxos de trabalho agênticos e processamento eficiente de grande contexto.