Modelos Alibaba compatíveis

Você pode importar grandes modelos de linguagem de buckets do Hugging Face e do OCI Object Storage para o OCI Generative AI, criar pontos finais para esses modelos e usá-los no serviço Generative AI.

Observação

Antes de selecionar um modelo, revise a orientação seguindo as tabelas de modelo nesta página para selecionar uma forma de unidade de hardware compatível e entender o faturamento para clusters de IA dedicados que hospedam modelos importados.

A família de modelos Alibaba Qwen possui capacidades multilíngues e multimodais avançadas. Para cartões de modelo no Hugging Face, consulte os links nas tabelas a seguir.

Qwen 3 Next

Modelo Qwen 3 Next Compatível
Abraçando o ID do modelo facial Capacidade do Modelo Forma Mínima da Unidade de Cluster de IA Dedicada
Qwen/Qwen3-Next-80B-A3B-Instruct TEXT_TO_TEXT
  • A100_80G_X4
  • H100_X4
  • H200_X4

Qwen 3.8

Modelos Qwen 3.8 Compatíveis
Abraçando o ID do modelo facial Capacidade do Modelo Forma Mínima da Unidade de Cluster de IA Dedicada
Qwen/Qwen3.8-27B IMAGE_TEXT_TO_TEXT
  • A100_40G_X2
  • A100_80G_X1
  • H100_X1
  • H200_X1
  • B200_X1
  • B300_X1
Qwen/Qwen3.8-2.4T-A95B-FP8 TEXT_TO_TEXT
  • B200_X16

Qwen 3.6

Modelo Qwen 3.6 Compatível
Abraçando o ID do modelo facial Capacidade do Modelo Forma Mínima da Unidade de Cluster de IA Dedicada
Qwen/Qwen3.6-35B-A3B IMAGE_TEXT_TO_TEXT
  • A100_80G_X2
  • H100_X2
  • H200_X1
  • B200_X1
Observação

Depois de importar o Qwen/Qwen3.6-35B-A3B e criar um ponto final para ele em um cluster de IA dedicado de hospedagem, você poderá chamar o modelo por meio da API de Respostas do OCI. Para obter a lista completa de modelos de chat disponíveis para a API de Respostas, consulte Modelos Disponíveis.

Qwen 3.5

Modelo Qwen 3.5 Compatível
Abraçando o ID do modelo facial Capacidade do Modelo Forma Mínima da Unidade de Cluster de IA Dedicada
Qwen/Qwen3.5-397B-A17B IMAGE_TEXT_TO_TEXT
  • H200_X8
  • B200_X8
  • B300_X4
Qwen/Qwen3.5-9B IMAGE_TEXT_TO_TEXT
  • A100_80GB_X1
  • H100_X1
  • H200_X1
  • B200_X1

Qwen Imagem

Modelos Qwen Image Compatíveis
Abraçando o ID do modelo facial Capacidade do Modelo Forma Mínima da Unidade de Cluster de IA Dedicada
Qwen/Qwen-Imagem TEXT_TO_IMAGE A100_80G_X1
Qwen/Qwen-Imagem-Editar IMAGE_TEXT_TO_IMAGE A100_80G_X1
Qwen/Qwen-Imagem-2512 TEXT_TO_IMAGE A100_80G_X1
Qwen/Qwen-Imagem-Edição-2511 IMAGE_TEXT_TO_IMAGE A100_80G_X1
Qwen/Qwen-Imagem-Edição-2509 IMAGE_TEXT_TO_IMAGE A100_80G_X1
Observação

  • response_format: "url" não funciona e retorna um erro de solicitação inválida HTTP 400.
  • n (número de imagens): somente 0 ou 1 funcionam.
  • O streaming não é compatível.
  • Tamanhos de imagem não padrão podem ser arredondados (por exemplo, 999x999992x992) em vez de retornar um HTTP 400 (ao contrário da API OpenAI).
  • A transparência pode não funcionar por causa das limitações do modelo.

Qwen Q (Razão)

Modelos Qwen Q Compatíveis
Abraçando o ID do modelo facial Capacidade do Modelo Forma Mínima da Unidade de Cluster de IA Dedicada
Qwen/QwQ-32B TEXT_TO_TEXT A100_80G_X2

Qwen 3

Modelos Qwen 3 Compatíveis
Abraçando o ID do modelo facial Capacidade do Modelo Forma Mínima da Unidade de Cluster de IA Dedicada
Qwen/Qwen3-Incorporação-0.6B INCORPORAÇÃO A10_X1
Qwen/Qwen3-Incorporação-4B INCORPORAÇÃO A10_X2
Qwen/Qwen3-Incorporação-8B INCORPORAÇÃO A100_80G_X1
Qwen/Qwen3-0.6B TEXT_TO_TEXT A100_80G_X1
Qwen/Qwen3-1.7B TEXT_TO_TEXT A100_80G_X1
Qwen/Qwen3-4B TEXT_TO_TEXT A100_80G_X1
Qwen/Qwen3-8B TEXT_TO_TEXT A100_80G_X1
Qwen/Qwen3-14B TEXT_TO_TEXT A100_80G_X1
Qwen/Qwen3-32B TEXT_TO_TEXT A100_80G_X2
Qwen/Qwen3-4B-Instruct-2507 TEXT_TO_TEXT A100_80G_X1
Qwen/Qwen3-30B-A3B-Instruct-2507 TEXT_TO_TEXT A100_80G_X2
Qwen/Qwen3-235B-A22B-Instruct-2507 TEXT_TO_TEXT H100_X8
Qwen/Qwen3-VL-30B-A3B-Instrução IMAGE_TEXT_TO_TEXT H100_X2
Qwen/Qwen3-VL-30B-A3B-Instruct-FP8 IMAGE_TEXT_TO_TEXT
  • H100_X2
  • H200_X2
Qwen/Qwen3-VL-235B-A22B-Instrução IMAGE_TEXT_TO_TEXT H100_X8

Qwen 2.5

Modelos Qwen2.5 Compatíveis
Abraçando o ID do modelo facial Capacidade do Modelo Forma Mínima da Unidade de Cluster de IA Dedicada
Qwen/Qwen2.5-Coder-32B-Instruct TEXT_TO_TEXT A100_80G_X2
Qwen/Qwen2.5-0.5B-Instrução TEXT_TO_TEXT A100_80G_X1
Qwen/Qwen2.5-1.5B-Instrução TEXT_TO_TEXT A100_80G_X1
Qwen/Qwen2.5-3B-Instrução TEXT_TO_TEXT A100_80G_X1
Qwen/Qwen2.5-7B-Instrução TEXT_TO_TEXT A100_80G_X1
Qwen/Qwen2.5-14B-Instrução TEXT_TO_TEXT A100_80G_X1
Qwen/Qwen2.5-32B-Instrução TEXT_TO_TEXT A100_80G_X2
Qwen/Qwen2.5-72B-Instrução TEXT_TO_TEXT A100_80G_X4
Qwen/Qwen2.5-VL-3B-Instrução IMAGE_TEXT_TO_TEXT A100_80G_X1
Qwen/Qwen2.5-VL-7B-Instrução IMAGE_TEXT_TO_TEXT A100_80G_X1
Qwen/Qwen2.5-VL-32B-Instrução IMAGEM_TEXTO_PARA_TEXTO A100_80G_X2
Qwen/Qwen2.5-VL-72B-Instrução IMAGEM_TEXTO_PARA_TEXTO A100_80G_X4

Qwen 2

Modelos Qwen2 Compatíveis
Abraçando o ID do modelo facial Capacidade do Modelo Forma Mínima da Unidade de Cluster de IA Dedicada
Qwen/Qwen2-0.5B-Instrução TEXT_TO_TEXT A100_80G_X1
Qwen/Qwen2-1.5B-Instrução TEXT_TO_TEXT A100_80G_X1
Qwen/Qwen2-7B-Instrução TEXTO_PARA_TEXTO A100_80G_X1
Qwen/Qwen2-72B-Instrução TEXTO_PARA_TEXTO A100_80G_X4
Qwen/Qwen2-VL-2B-Instrução IMAGEM_TEXTO_PARA_TEXTO A100_80G_X1
Qwen/Qwen2-VL-7B-Instrução IMAGEM_TEXTO_PARA_TEXTO A100_80G_X1
Qwen/Qwen2-VL-72B-Instrução IMAGEM_TEXTO_PARA_TEXTO A100_80G_X4
Importante

  • Para modelos importados, você pode usar o tamanho do contexto nativo especificado pelo provedor do modelo. No entanto, o tamanho máximo de contexto efetivo é limitado pela configuração de hardware subjacente que você seleciona para hospedar clusters de IA dedicados na OCI Generative AI. Para aproveitar ao máximo o tamanho do contexto nativo de um modelo, talvez seja necessário provisionar mais recursos de hardware.
  • Requisitos do modelo ajustado

    Você pode ajustar os modelos base suportados listados nesta página fora do OCI Generative AI e importar os modelos resultantes se eles atenderem aos seguintes requisitos:

    • O modelo ajustado deve usar a mesma versão do transformador que o modelo base suportado.
    • Sua contagem total de parâmetros deve estar dentro de ±10% do modelo base original.

    Para modelos ajustados com LoRA:

    • Antes da implantação, mescle os pesos do adaptador LoRA no modelo base.
    • Você pode mesclar os pesos automaticamente usando PEFT ou um repositório ou ferramenta semelhante.
    • A mesclagem torna o modelo transparente ao mecanismo de serviço e fornece o melhor desempenho.
    • Cada modelo ajustado pode conter os pesos mesclados de apenas um adaptador LoRA.
  • Para decidir onde você pode hospedar um modelo importado, localize uma forma de unidade compatível para o modelo na tabela desta página e, em seguida, confirme se a forma de hardware está disponível na região de destino em Formas de Unidade de Hardware por Região. Um modelo só pode ser hospedado em uma região quando a região fornece uma forma de hardware listada para esse modelo.
  • Para obter etapas sobre como implantar os modelos importados, consulte Gerenciando Modelos Importados.
Observação

Faturamento para Clusters de IA Dedicados que Hospedam Modelos Importados

Os clusters de IA dedicados que hospedam modelos importados não exigem o compromisso mínimo de 744 horas por unidade que se aplica a clusters de IA dedicados que hospedam modelos pré-treinados disponíveis na OCI Generative AI. Em vez disso, um cluster de IA dedicado a modelo importado tem uma duração mínima faturável de uma hora. Por exemplo, um cluster que usa uma unidade de IA e é executado por 30 minutos é cobrado por uma unidade de hora de IA.

Após a primeira hora, as cobranças são baseadas no tempo de execução real do cluster e são rateadas para milissegundos. Por exemplo, um cluster executado por uma hora e um minuto é cobrado por essa duração, em vez de duas horas completas.

A OCI envia registros de uso para Medição e Faturamento a cada cinco minutos enquanto o cluster está em execução. Se o cluster for excluído antes que o mínimo de uma hora seja atingido, a OCI continuará reportando o uso faturável até que o mínimo seja atendido. Se o cluster for executado por mais de uma hora, a OCI continuará enviando registros de uso a cada cinco minutos até que o cluster seja excluído.