Creazione di un cluster AI dedicato per i modelli di hosting

Crea una risorsa cluster AI dedicata in OCI Generative AI per ospitare endpoint per modelli di base pre-addestrati, modelli personalizzati o modelli importati.

Un cluster AI dedicato all'hosting fornisce le risorse di computazione per l'inferenza del modello. Il modello o il modello di base e la forma dell'unità selezionati durante la creazione del cluster determinano i modelli compatibili. Dopo l'attivazione del cluster, creare uno o più endpoint del modello per accedere al modello hosted.

Importante

  • Non disponibile on-demand: tutti i modelli pre-addestrati di base dell'AI generativa OCI supportati per la modalità di servizio su richiesta che utilizzano le API di generazione testo e riepilogo (incluso il parco giochi) sono ora ritirati. Si consiglia di utilizzare i modelli di chat.
  • Possono essere ospitati nei cluster: se si ospita un modello di generazione di riepilogo o un modello di generazione come cohere.command in un cluster AI dedicato (modalità di servizio dedicata), è possibile continuare a utilizzare tale modello fino a quando non viene ritirato. Questi modelli, se ospitati su un cluster AI dedicato, sono disponibili solo nel Midwest degli Stati Uniti (Chicago). Vedere API non più valide nell'intelligenza artificiale generativa per la data in cui le API non sono più disponibili.
    1. Nella pagina elenco Cluster AI dedicati, selezionare Crea cluster AI dedicato. Per assistenza nella ricerca della pagina elenco, vedere Elenca cluster AI dedicati.
    2. Selezionare un compartimento in cui creare il cluster AI dedicato. Il compartimento predefinito è uguale alla pagina di elenco, ma è possibile selezionare qualsiasi compartimento nel quale si è autorizzati a lavorare.
    3. (Facoltativo) Immettere il nome e la descrizione del cluster. Se non si immette un nome, il sistema ne genera uno che sarà possibile modificare in seguito.

      Il nome generato ha il formato generativeaidedicatedaicluster<timestamp>. Ad esempio: generativeaidedicatedaicluster20250922181431

    4. Per Tipo di cluster, selezionare Hosting.
    5. Per Modello base, selezionare una delle opzioni riportate di seguito.
      • Il modello di base pre-addestrato che stai ospitando.
      • Se si utilizza un modello personalizzato, ottimizzato da un modello di base, selezionare il modello di base originale su cui è stato addestrato.
      • Se si utilizza un modello importato, selezionare il modello importato.
    6. Se è stato selezionato un modello importato, selezionare una dimensione unità consigliata.
      Per suggerimenti sulle dimensioni delle unità, andare a Modelli compatibili per l'importazione e selezionare il modello.

      I nomi forma unità hanno due parti: il tipo di istanza e il numero di schede. Esempio: H100_X1 = H100 with 1 card. Per A100, sono disponibili sia A100-80G che A100-40G; la dimensione della memoria nel nome (80G o 40G) li distingue.

      Importante

      Non è possibile modificare la forma dell'unità dopo aver creato un cluster AI dedicato.
    7. (Facoltativo) Aumentare il numero di istanze nel campo Replica modello.
      Importante

      Quando si crea un cluster per l'hosting di modelli per l'inferenza, per impostazione predefinita viene creata un'unità per il modello selezionato. Per aumentare il throughput, aumentare il numero di istanze nel campo Replica modello ora o in un secondo momento quando si modifica il cluster. Ad esempio, la creazione di due repliche di modello in questo cluster richiede due unità. La creazione di endpoint modello aggiuntivi non aggiunge repliche né aumenta il throughput.
    8. Leggere le ore dell'unità di impegno per il cluster hosting e selezionare la casella di controllo per accettare l'impegno.
      Importante

      Fatturazione per cluster AI dedicati che ospitano modelli importati

      I cluster AI dedicati che ospitano un modello importato non richiedono l'impegno minimo di 744 ore di unità che si applica AI cluster AI dedicati che ospitano modelli pre-addestrati disponibili nell'AI generativa OCI. Invece, un cluster AI dedicato modello importato ha una durata fatturabile minima di un'ora. Ad esempio, un cluster che utilizza un'unità AI ed è in esecuzione per 30 minuti viene fatturato per un'unità oraria AI.

      Dopo la prima ora, i costi si basano sul tempo di esecuzione effettivo del cluster e vengono ripartiti proporzionalmente al millisecondo. Ad esempio, un cluster che viene eseguito per un'ora e un minuto viene fatturato per tale durata, anziché per due ore complete.

      OCI invia record d'uso alla misurazione e alla fatturazione ogni cinque minuti durante l'esecuzione del cluster. Se il cluster viene eliminato prima del raggiungimento del valore minimo di un'ora, OCI continua a generare report sull'uso fatturabile fino a quando non viene raggiunto il valore minimo. Se il cluster viene eseguito per più di un'ora, OCI continua a inviare record di utilizzo ogni cinque minuti fino all'eliminazione del cluster.

    9. (Facoltativo) Selezionare Aggiungi tag e assegnare tag a questo cluster.
    10. Selezionare Crea.
    Nota

    La creazione dei cluster richiede alcuni minuti. Dopo che il cluster si trova in stato attivo, selezionarlo quando si crea un endpoint per il modello. Per impostazione predefinita, un cluster di hosting può avere fino a 50 endpoint modello. Vedere Capacità endpoint.
  • Usare il comando dedicated-AI-cluster create e i parametri richiesti per creare un cluster AI dedicato:

    oci generative-ai dedicated-ai-cluster create 
    --compartment-id <compartment-OCID>
    --type HOSTING
    --unit-count [integer]
    --unit-shape [text]
    [OPTIONS]

    Per un elenco completo dei parametri e dei valori per i comandi CLI, consultare il manuale CLI Command Reference.

  • Eseguire l'operazione CreateDedicatedAiCluster per creare un cluster dedicato.