Modelos MiniMax compatíveis

Você pode importar grandes modelos de linguagem de Hugging Face e buckets do OCI Object Storage para a OCI Generative AI, criar pontos finais para esses modelos e usá-los no serviço Generative AI.

Observação

Antes de selecionar um modelo, revise a orientação seguindo as tabelas de modelo nesta página para selecionar uma forma de unidade de hardware compatível e entender o faturamento para clusters de IA dedicados que hospedam modelos importados.

MiniMax M3

O modelo MiniMax-M3-MXFP8 é a variante quantizada MXFP8 de MiniMax M3, um modelo multimodal nativo com um milhão de contexto de token. O modelo tem cerca de 428 bilhões de parâmetros totais com cerca de 23 bilhões de parâmetros ativados e usa a Atenção Esparsa MiniMax (MSA) para processamento eficiente de longo contexto. Esse modelo é otimizado para codificação, fluxos de trabalho agênticos de longa duração e tarefas de produtividade colaborativas.

Modelos MiniMax M3 Compatíveis
Abraçando o ID do modelo facial Capacidade do Modelo Forma Mínima da Unidade de Cluster de IA Dedicada
MiniMaxAI/MiniMax-M3-MXFP8 TEXTO_PARA_TEXTO
  • H200_X8
  • B200_X8

MiniMax M2

Os modelos de texto para texto MiniMax M2 são otimizados para codificação, raciocínio complexo e fluxos de trabalho agênticos, como tarefas de uso de ferramentas, pesquisa e produtividade. MiniMax-M2 é um modelo Mixture-of-Experts (MoE) projetado para codificação eficiente e desempenho agêntico, e mais tarde modelos MiniMax-M2 estender esse foco para mais avançada engenharia de software e tarefas de trabalho profissional. Para mais detalhes, consulte MiniMax na documentação Hugging Face.

Modelos MiniMax M2 Compatíveis
Abraçando o ID do modelo facial Capacidade do Modelo Forma Mínima da Unidade de Cluster de IA Dedicada
MiniMaxAI/MiniMax-M2.7 TEXTO_PARA_TEXTO
  • H100_X8
  • H200_X8
MiniMaxAI/MiniMax-M2.5 TEXTO_PARA_TEXTO
  • H100_X8
  • H200_X8
MiniMaxAI/MiniMax-M2 TEXTO_PARA_TEXTO
  • H100_X8
  • H200_X8
Importante

  • Para modelos importados, você pode usar o tamanho do contexto nativo especificado pelo provedor do modelo. No entanto, o tamanho máximo de contexto efetivo é limitado pela configuração de hardware subjacente que você seleciona para hospedar clusters de IA dedicados na OCI Generative AI. Para aproveitar ao máximo o tamanho do contexto nativo de um modelo, talvez seja necessário provisionar mais recursos de hardware.
  • Requisitos do modelo ajustado

    Você pode ajustar os modelos base suportados listados nesta página fora do OCI Generative AI e importar os modelos resultantes se eles atenderem aos seguintes requisitos:

    • O modelo ajustado deve usar a mesma versão do transformador que o modelo base suportado.
    • Sua contagem total de parâmetros deve estar dentro de ±10% do modelo base original.

    Para modelos ajustados com LoRA:

    • Antes da implantação, mescle os pesos do adaptador LoRA no modelo base.
    • Você pode mesclar os pesos automaticamente usando PEFT ou um repositório ou ferramenta semelhante.
    • A mesclagem torna o modelo transparente ao mecanismo de serviço e fornece o melhor desempenho.
    • Cada modelo ajustado pode conter os pesos mesclados de apenas um adaptador LoRA.
  • Para decidir onde você pode hospedar um modelo importado, localize uma forma de unidade compatível para o modelo na tabela desta página e, em seguida, confirme se a forma de hardware está disponível na região de destino em Formas de Unidade de Hardware por Região. Um modelo só pode ser hospedado em uma região quando a região fornece uma forma de hardware listada para esse modelo.
  • Para obter etapas sobre como implantar os modelos importados, consulte Gerenciando Modelos Importados.
Observação

Faturamento para Clusters de IA Dedicados que Hospedam Modelos Importados

Os clusters de IA dedicados que hospedam modelos importados não exigem o compromisso mínimo de 744 horas por unidade que se aplica a clusters de IA dedicados que hospedam modelos pré-treinados disponíveis na OCI Generative AI. Em vez disso, um cluster de IA dedicado a modelo importado tem uma duração mínima faturável de uma hora. Por exemplo, um cluster que usa uma unidade de IA e é executado por 30 minutos é cobrado por uma unidade de hora de IA.

Após a primeira hora, as cobranças são baseadas no tempo de execução real do cluster e são rateadas para milissegundos. Por exemplo, um cluster executado por uma hora e um minuto é cobrado por essa duração, em vez de duas horas completas.

A OCI envia registros de uso para Medição e Faturamento a cada cinco minutos enquanto o cluster está em execução. Se o cluster for excluído antes que o mínimo de uma hora seja atingido, a OCI continuará reportando o uso faturável até que o mínimo seja atendido. Se o cluster for executado por mais de uma hora, a OCI continuará enviando registros de uso a cada cinco minutos até que o cluster seja excluído.