Gerenciando Pontos Finais do Modelo

Use pontos finais de modelo para enviar solicitações de inferência a modelos pré-treinados, personalizados ou importados hospedados em clusters de IA dedicados na OCI Generative AI.

Um ponto final de modelo é um ponto de acesso nomeado separadamente em que um modelo aceita solicitações de inferência e retorna respostas. Crie um ponto final de modelo em um cluster dedicado de IA de hospedagem. Um modelo hospedado no modo sob demanda não requer um ponto final de modelo em um cluster de IA dedicado.

Como os Pontos Finais do Modelo Usam um Cluster de Hospedagem

Um cluster de IA dedicado de hospedagem deve ter pelo menos uma réplica de modelo. As réplicas de modelo usam unidades de IA dedicadas e fornecem os recursos de computação para inferência. Os pontos finais do modelo usam o modelo e os recursos de computação provisionados no cluster.

A criação de pontos finais de modelo adicionais não adiciona réplicas de modelo nem aumenta o throughput de inferência do cluster. Para aumentar o throughput, adicione réplicas de modelo ao cluster de hospedagem.

Ao criar um cluster de hospedagem, você seleciona um modelo base pré-treinado, o modelo base de um modelo personalizado ou um modelo importado específico. O modelo usado por um ponto final deve ser compatível com essa seleção de cluster e sua forma de unidade. Modelos não relacionados não podem compartilhar o mesmo cluster. Para compatibilidade de ponto final e cluster específicos do modelo, consulte a página de modelo aplicável.

Observação

Os clusters de hospedagem para modelos importados não exigem o compromisso mínimo de 744 horas por unidade que se aplica à hospedagem de clusters para modelos pré-treinados e personalizados do OCI Generative AI. Essa diferença de faturamento não remove o requisito de criar um ponto final de modelo para acessar um modelo importado. Consulte Formas de Unidade de Hardware para Modelos Importados.

Capacidade do Ponto Final

Por padrão, um cluster de IA dedicado de hospedagem pode ter até 50 pontos finais de modelo. Na página de detalhes do cluster de IA dedicado, Capacidade de ponto final restante mostra quantos pontos finais de modelo adicionais o cluster pode suportar abaixo de seu limite atual. Por exemplo, um cluster com capacidade de 50 e um ponto final existente mostra uma capacidade de ponto final restante de 49.

Você pode criar vários pontos finais como aliases para um modelo compatível e usá-los para diferentes usuários, aplicativos ou finalidades. Onde suportado, cada ponto final pode ter sua própria configuração de ponto final, como acesso à rede pública ou privada e definições de guardrail. Os pontos finais compartilham os recursos de computação e as réplicas de modelo provisionadas no cluster.

Se você não precisar mais de um ponto final, exclua o ponto final para que possa usar a capacidade de ponto final disponível do cluster para outro ponto final.

Dica

Para mais de 50 pontos finais em um cluster de hospedagem, solicite um aumento no limite do serviço para endpoint-per-dedicated-unit-count. Consulte Limites de Serviço do Serviço Generative AI.

Pontos Finais do Modelo e Pontos Finais Privados

Um ponto final de modelo e um ponto final privado servem para diferentes propósitos. Um ponto final de modelo fornece acesso a um modelo hospedado em um cluster de IA dedicado. Um ponto final privado fornece um caminho de rede privada para o OCI Generative AI por meio de uma VCN (rede virtual na nuvem).

Para acessar um modelo em um cluster de IA dedicado por meio de uma rede privada, primeiro crie um ponto final privado. Em seguida, quando você criar o ponto final do modelo no cluster, selecione o ponto final privado para acesso à rede.

Tarefas de Gerenciamento

Observação

Depois de criar um ponto final ativo para um modelo personalizado ou importado, o modelo estará disponível na lista de modelos do playground.

Você pode executar as seguintes tarefas para criar e gerenciar pontos finais de modelo: