Gestione degli endpoint dei modelli
Utilizza gli endpoint dei modelli per inviare richieste di inferenza a modelli pre-addestrati, personalizzati o importati ospitati su cluster AI dedicati nell'AI generativa OCI.
Un endpoint modello è un punto di accesso denominato separatamente in cui un modello accetta richieste di inferenza e restituisce risposte. È possibile creare un endpoint modello in un cluster AI dedicato hosting. Un modello ospitato in modalità on-demand non richiede un endpoint modello in un cluster AI dedicato.
Modalità di utilizzo di un cluster di hosting da parte degli endpoint del modello
Un cluster AI dedicato di hosting deve avere almeno una replica del modello. Le repliche dei modelli utilizzano unità AI dedicate e forniscono le risorse di calcolo per l'inferenza. Gli endpoint del modello utilizzano il modello e le risorse di computazione di cui è stato eseguito il provisioning nel cluster.
La creazione di endpoint modello aggiuntivi non aggiunge repliche del modello né aumenta il throughput di inferenza del cluster. Per aumentare il throughput, aggiungere le repliche del modello al cluster di hosting.
Quando si crea un cluster di hosting, si seleziona un modello di base pre-addestrato, il modello di base per un modello personalizzato o un modello importato specifico. Il modello utilizzato da un endpoint deve essere compatibile con la selezione cluster e la relativa forma di unità. I modelli non correlati non possono condividere lo stesso cluster. Per la compatibilità di endpoint e cluster specifici del modello, vedere la pagina del modello applicabile.
I cluster di hosting per i modelli importati non richiedono l'impegno minimo di 744 ore per l'hosting dei cluster per i modelli pre-addestrati e personalizzati di OCI Generative AI. Questa differenza di fatturazione non rimuove il requisito di creazione di un endpoint modello per accedere a un modello importato. Vedere Forme unità hardware per i modelli importati.
Capacità endpoint
Per impostazione predefinita, un cluster AI dedicato all'hosting può avere fino a 50 endpoint di modello. Nella pagina dei dettagli del cluster AI dedicata, Capacità endpoint rimanente mostra il numero di endpoint modello aggiuntivi che il cluster può supportare al di sotto del limite corrente. Ad esempio, un cluster con una capacità di 50 e un endpoint esistente mostra una capacità endpoint rimanente di 49.
È possibile creare più endpoint come alias per un modello compatibile e utilizzarli per utenti, applicazioni o scopi diversi. Se supportato, ogni endpoint può avere la propria configurazione endpoint, ad esempio l'accesso di rete pubblico o privato e le impostazioni di guardrail. Gli endpoint condividono le risorse di computazione e le repliche del modello di cui è stato eseguito il provisioning nel cluster.
Se non è più necessario un endpoint, eliminarlo in modo da poter utilizzare la capacità endpoint disponibile del cluster per un altro endpoint.
Per più di 50 endpoint su un cluster di hosting, richiedere un aumento del limite del servizio per
endpoint-per-dedicated-unit-count. Vedere Limiti del servizio per l'intelligenza artificiale generativa.Endpoint del modello e endpoint privati
Un endpoint modello e un endpoint privato hanno scopi diversi. Un endpoint modello fornisce l'accesso a un modello ospitato su un cluster AI dedicato. Un endpoint privato fornisce un percorso di rete privato all'AI generativa OCI tramite una rete cloud virtuale (VCN).
Per accedere a un modello su un cluster AI dedicato tramite una rete privata, prima creare un endpoint privato. Quindi, quando si crea l'endpoint del modello nel cluster, selezionare l'endpoint privato per l'accesso alla rete.
Task di gestione
Dopo aver creato un endpoint attivo per un modello personalizzato o importato, il modello è disponibile nell'elenco dei modelli del parco giochi.
Per creare e gestire gli endpoint del modello, è possibile eseguire i task riportati di seguito.