Modelos compatíveis para importação

Você pode importar grandes modelos de linguagem de código aberto e de terceiros de Hugging Face e buckets do OCI Object Storage para a OCI Generative AI. Depois de importar um modelo, você pode hospedá-lo em um cluster de IA dedicado, criar um ponto final e usá-lo no serviço Generative AI.

Importante

  • Os modelos importados não exigem o compromisso mínimo de hospedagem de 744 horas por unidade que se aplica quando você hospeda modelos pré-treinados disponíveis na OCI Generative AI em clusters de IA dedicados.

  • Seu uso desses modelos pode estar sujeito a termos separados dos fornecedores terceirizados aplicáveis, e você é responsável por sua conformidade com tais termos. A Oracle se isenta de todas as garantias, indenizações e responsabilidades decorrentes ou relacionadas a quaisquer LLMs de código aberto ou de terceiros que você importar.

  • Para obter formas de hardware disponíveis e etapas sobre como implantar os modelos importados, consulte Formas de Unidade de Hardware de Cluster de IA Dedicado.

Arquitetura de Modelo Importada da OCI Generative AI

O serviço OCI Generative AI usa o Open Model Engine (OME) para implementar e gerenciar modelos importados. O OME atua como a camada de orquestração entre a GPU e o runtime de inferência.

Quando você implanta um modelo importado, o OME analisa o modelo e o combina com o runtime mais eficiente: vLLM (otimizado para alto throughput) e SGLang (otimizado para alto desempenho). Os mecanismos de runtime vLLM e SGLang executam os modelos nas GPUs.

Alguns modelos são altamente otimizados para SGLang (como LLMs de larga escala e aqueles que exigem RadixAttention para memória de contexto longo), enquanto outros têm melhores kernels da comunidade em vLLM (como LLMs de código aberto populares e modelos multimodais).

Modelos compatíveis

  • Alibaba Qwen

    Apresenta casos de uso multilíngues e multimodais avançados.

  • DeepSeek

    Otimizado para codificação, matemática e raciocínio complexo.

  • Google Gemma

    Desenvolvido para amplo processamento de linguagem e casos de uso de uso de uso geral.

  • Meta Llama

    Modelos com GQA (Agruped Query Attention) aprimorado para melhorar o desempenho.

  • Microsoft Phi

    Modelos compactos e eficientes para implementações escaláveis.

  • MiniMax

    Modelos eficientes de Mistura de Especialistas (MoE) otimizados para codificação, raciocínio complexo e fluxos de trabalho agênticos.

  • Mistral

    Inclui modelos de incorporação e chat. O modelo de incorporação é adequado para um manuseio eficiente de longo contexto.

  • Moonshot AI Kimi

    Modelos de texto para texto otimizados para codificação de longa duração, fluxos de trabalho agênticos e tarefas complexas de engenharia de software.

  • NVIDIA Nemotron

    Modelos de peso aberto com dados e receitas de treinamento publicados, adequados para a criação de agentes de IA especializados.

  • Sussurro OpenAI

    Modelo de áudio para texto para transcrição multilíngue e cargas de trabalho de reconhecimento automático de fala de alto rendimento.

  • GptOs OpenAI

    Modelos de Mixture-of-Experts (MoE) de peso aberto para raciocínio eficiente e manuseio de grande contexto.

  • Z.ai GLM

    Modelos de geração de texto otimizados para codificação de longa duração, fluxos de trabalho agênticos e processamento eficiente de grande contexto.