Modelos compatíveis de GptOss OpenAI

Você pode importar grandes modelos de linguagem de Hugging Face e buckets do OCI Object Storage para a OCI Generative AI, criar pontos finais para esses modelos e usá-los no serviço Generative AI.

Observação

Antes de selecionar um modelo, revise a orientação seguindo as tabelas de modelo nesta página para selecionar uma forma de unidade de hardware compatível e entender o faturamento para clusters de IA dedicados que hospedam modelos importados.

Esses modelos têm uma arquitetura avançada de transformador de peso aberto com arquitetura Mixture-of-Experts (MoE), otimizada para raciocínio de linguagem eficiente e de alta qualidade e grande tratamento de contexto. Para obter mais informações, consulte GptOss na documentação do Hugging Face.

GptOss

Modelos OpenAI Compatíveis
Abraçando o ID do modelo facial Capacidade do Modelo Forma Mínima da Unidade de Cluster de IA Dedicada
openai/gpt-oss-20b TEXTO_PARA_TEXTO H100_X1
openai/gpt-oss-120b TEXTO_PARA_TEXTO H100_X2
Importante

  • Para modelos importados, você pode usar o tamanho do contexto nativo especificado pelo provedor do modelo. No entanto, o tamanho máximo de contexto efetivo é limitado pela configuração de hardware subjacente que você seleciona para hospedar clusters de IA dedicados na OCI Generative AI. Para aproveitar ao máximo o tamanho do contexto nativo de um modelo, talvez seja necessário provisionar mais recursos de hardware.
  • Requisitos do modelo ajustado

    Você pode ajustar os modelos base suportados listados nesta página fora do OCI Generative AI e importar os modelos resultantes se eles atenderem aos seguintes requisitos:

    • O modelo ajustado deve usar a mesma versão do transformador que o modelo base suportado.
    • Sua contagem total de parâmetros deve estar dentro de ±10% do modelo base original.

    Para modelos ajustados com LoRA:

    • Antes da implantação, mescle os pesos do adaptador LoRA no modelo base.
    • Você pode mesclar os pesos automaticamente usando PEFT ou um repositório ou ferramenta semelhante.
    • A mesclagem torna o modelo transparente ao mecanismo de serviço e fornece o melhor desempenho.
    • Cada modelo ajustado pode conter os pesos mesclados de apenas um adaptador LoRA.
  • Para decidir onde você pode hospedar um modelo importado, localize uma forma de unidade compatível para o modelo na tabela desta página e, em seguida, confirme se a forma de hardware está disponível na região de destino em Formas de Unidade de Hardware por Região. Um modelo só pode ser hospedado em uma região quando a região fornece uma forma de hardware listada para esse modelo.
  • Para obter etapas sobre como implantar os modelos importados, consulte Gerenciando Modelos Importados.
Observação

Faturamento para Clusters de IA Dedicados que Hospedam Modelos Importados

Os clusters de IA dedicados que hospedam modelos importados não exigem o compromisso mínimo de 744 horas por unidade que se aplica a clusters de IA dedicados que hospedam modelos pré-treinados disponíveis na OCI Generative AI. Em vez disso, um cluster de IA dedicado a modelo importado tem uma duração mínima faturável de uma hora. Por exemplo, um cluster que usa uma unidade de IA e é executado por 30 minutos é cobrado por uma unidade de hora de IA.

Após a primeira hora, as cobranças são baseadas no tempo de execução real do cluster e são rateadas para milissegundos. Por exemplo, um cluster executado por uma hora e um minuto é cobrado por essa duração, em vez de duas horas completas.

A OCI envia registros de uso para Medição e Faturamento a cada cinco minutos enquanto o cluster está em execução. Se o cluster for excluído antes que o mínimo de uma hora seja atingido, a OCI continuará reportando o uso faturável até que o mínimo seja atendido. Se o cluster for executado por mais de uma hora, a OCI continuará enviando registros de uso a cada cinco minutos até que o cluster seja excluído.