Modelos compatíveis da Microsoft

Você pode importar grandes modelos de linguagem de buckets do Hugging Face e do OCI Object Storage para o OCI Generative AI, criar pontos finais para esses modelos e usá-los no serviço Generative AI.

Observação

Antes de selecionar um modelo, revise a orientação seguindo as tabelas de modelo nesta página para selecionar uma forma de unidade de hardware compatível e entender o faturamento para clusters de IA dedicados que hospedam modelos importados.

Os modelos Microsoft Phi-3, conhecidos por sua eficiência e compacidade, são projetados para desempenho escalável e flexível. Consulte a documentação do Phi-3 sobre o Hugging Face.

Phi 3

Modelos Phi 3 Compatíveis
Abraçando o ID do modelo facial Capacidade do Modelo Forma Mínima da Unidade de Cluster de IA Dedicada
microsoft/phi-4 TEXT_TO_TEXT A100_80G_X1
microsoft/Phi-3-mini-4k-instruct TEXT_TO_TEXT A100_80G_X1
microsoft/Phi-3-mini-128k-instruct TEXT_TO_TEXT A100_80G_X1
microsoft/Phi-3-small-8k-instruct TEXT_TO_TEXT A100_80G_X1
microsoft/Phi-3-medium-4k-instruct TEXT_TO_TEXT A100_80G_X1
microsoft/Phi-3-vision-128k-instruct IMAGE_TEXT_TO_TEXT H100_X1
Importante

  • Para modelos importados, você pode usar o tamanho do contexto nativo especificado pelo provedor do modelo. No entanto, o tamanho máximo de contexto efetivo é limitado pela configuração de hardware subjacente que você seleciona para hospedar clusters de IA dedicados na OCI Generative AI. Para aproveitar ao máximo o tamanho do contexto nativo de um modelo, talvez seja necessário provisionar mais recursos de hardware.
  • Requisitos do modelo ajustado

    Você pode ajustar os modelos base suportados listados nesta página fora do OCI Generative AI e importar os modelos resultantes se eles atenderem aos seguintes requisitos:

    • O modelo ajustado deve usar a mesma versão do transformador que o modelo base suportado.
    • Sua contagem total de parâmetros deve estar dentro de ±10% do modelo base original.

    Para modelos ajustados com LoRA:

    • Antes da implantação, mescle os pesos do adaptador LoRA no modelo base.
    • Você pode mesclar os pesos automaticamente usando PEFT ou um repositório ou ferramenta semelhante.
    • A mesclagem torna o modelo transparente ao mecanismo de serviço e fornece o melhor desempenho.
    • Cada modelo ajustado pode conter os pesos mesclados de apenas um adaptador LoRA.
  • Para decidir onde você pode hospedar um modelo importado, localize uma forma de unidade compatível para o modelo na tabela desta página e, em seguida, confirme se a forma de hardware está disponível na região de destino em Formas de Unidade de Hardware por Região. Um modelo só pode ser hospedado em uma região quando a região fornece uma forma de hardware listada para esse modelo.
  • Para obter etapas sobre como implantar os modelos importados, consulte Gerenciando Modelos Importados.
Observação

Faturamento para Clusters de IA Dedicados que Hospedam Modelos Importados

Os clusters de IA dedicados que hospedam modelos importados não exigem o compromisso mínimo de 744 horas por unidade que se aplica a clusters de IA dedicados que hospedam modelos pré-treinados disponíveis na OCI Generative AI. Em vez disso, um cluster de IA dedicado a modelo importado tem uma duração mínima faturável de uma hora. Por exemplo, um cluster que usa uma unidade de IA e é executado por 30 minutos é cobrado por uma unidade de hora de IA.

Após a primeira hora, as cobranças são baseadas no tempo de execução real do cluster e são rateadas para milissegundos. Por exemplo, um cluster executado por uma hora e um minuto é cobrado por essa duração, em vez de duas horas completas.

A OCI envia registros de uso para Medição e Faturamento a cada cinco minutos enquanto o cluster está em execução. Se o cluster for excluído antes que o mínimo de uma hora seja atingido, a OCI continuará reportando o uso faturável até que o mínimo seja atendido. Se o cluster for executado por mais de uma hora, a OCI continuará enviando registros de uso a cada cinco minutos até que o cluster seja excluído.