Modelli Google compatibili

Puoi importare modelli di linguaggio di grandi dimensioni dai bucket di storage degli oggetti Hugging Face e OCI nell'AI generativa OCI, creare endpoint per tali modelli e utilizzarli nel servizio AI generativa.

Nota

Prima di selezionare un modello, esaminare le istruzioni riportate nelle tabelle modello in questa pagina per selezionare una forma di unità hardware compatibile e comprendere la fatturazione per i cluster AI dedicati che ospitano i modelli importati.

Per i dettagli dei modelli, vedere i collegamenti riportati di seguito.

MedGemma

Google MedGemma 27B Text IT è un modello linguistico di 27 miliardi di parametri basato sull'architettura Gemma 3. Addestrato sulla letteratura medica e sulle cartelle cliniche, il modello è sintonizzato sulle istruzioni (IT), che consente di seguire meglio le richieste degli utenti e aiutare a eseguire attività incentrate sull'assistenza sanitaria come la risposta alle domande mediche, il supporto clinico e il riepilogo.

Modello MedGemma compatibile
ID modello viso abbraccio Capacità modello Forma unità cluster AI dedicata minima
google/medgemma-27b-testo-it TEXT_TO_TEXT
  • A100_80 GB_X2
  • H100_X2
  • H200_X1
  • B200_X1

Gemma

Modelli compatibili Gemma
ID modello viso abbraccio Capacità modello Forma unità cluster AI dedicata minima
google/gemma-4-31b-it TEXT_TO_TEXT
  • A100_40G_X4
  • A100_80G_X2
  • H100_X2
  • H200_X1
  • B200_X1
google/gemma-4-12B-it IMAGE_TEXT_TO_TEXT
  • A100_40G_X1
  • A100_80G_X1
  • H100_X1
  • H200_X1
  • B200_X1
google/gemma-4-26B-A4B IMAGE_TEXT_TO_TEXT
  • A10X4
  • A100_40G_X2
  • A100_80G_X1
  • H100_X1
  • H200_X1
  • B200_X1
google/gemma-3-4b-it IMAGE_TEXT_TO_TEXT A100_80G_X1
google/gemma-3-270m-it TEXT_TO_TEXT A100_80G_X1
google/gemma-3-27b-it TESTO_IMMAGINE_TESTO_TESTO A100_80G_X2
google/gemma-3-12b-it TESTO_IMMAGINE_TESTO_TESTO
  • A100_40G_X4
  • A100_80G_X1
  • H100_X2
  • H200_X1
google/gemma-3-1b-it TEXT_TO_TEXT A100_80G_X1
google/gemma-2-9b-it TEXT_TO_TEXT A100_80G_X1
google/gemma-2-27b-it TESTO_A_TESTO A100_80G_X2
google/gemma-2-2b-it TESTO_A_TESTO A100_80G_X1
Nota

Dopo aver importato google/gemma-4-31b-it e creato un endpoint su un cluster AI dedicato di hosting, è possibile chiamare il modello tramite l'API Risposte OCI. Per l'elenco completo dei modelli di chat disponibili per l'API Risposte, vedere Modelli disponibili.

Importante

  • Per i modelli importati, è possibile utilizzare la lunghezza del contesto nativo specificata dal provider del modello. Tuttavia, la lunghezza massima effettiva del contesto è limitata dall'impostazione hardware di base selezionata per l'hosting dei cluster AI dedicati in OCI Generative AI. Per sfruttare appieno la lunghezza del contesto nativo di un modello, potrebbe essere necessario eseguire il provisioning di più risorse hardware.
  • Utilizzare i modelli ottimizzati solo se corrispondono alla versione del trasformatore del modello di base compatibile e hanno un conteggio dei parametri entro ±10% dell'originale.
  • Per decidere dove ospitare un modello importato, trovare una forma di unità compatibile per il modello nella tabella in questa pagina, quindi verificare che la forma hardware sia disponibile nell'area di destinazione in Forme unità hardware per area. Un modello può essere ospitato in un'area solo quando l'area fornisce una forma hardware elencata per tale modello.
  • Per i passi su come distribuire i modelli importati, vedere Gestione dei modelli importati.
Nota

Fatturazione per cluster AI dedicati che ospitano modelli importati

I cluster AI dedicati che ospitano modelli importati non richiedono l'impegno minimo di 744 ore che si applica AI cluster AI dedicati che ospitano modelli pre-addestrati disponibili nell'AI generativa OCI. Invece, un cluster AI dedicato modello importato ha una durata fatturabile minima di un'ora. Ad esempio, un cluster che utilizza un'unità AI ed è in esecuzione per 30 minuti viene fatturato per un'unità oraria AI.

Dopo la prima ora, i costi si basano sul tempo di esecuzione effettivo del cluster e vengono ripartiti proporzionalmente al millisecondo. Ad esempio, un cluster che viene eseguito per un'ora e un minuto viene fatturato per tale durata, anziché per due ore complete.

OCI invia record d'uso alla misurazione e alla fatturazione ogni cinque minuti durante l'esecuzione del cluster. Se il cluster viene eliminato prima del raggiungimento del valore minimo di un'ora, OCI continua a generare report sull'uso fatturabile fino a quando non viene raggiunto il valore minimo. Se il cluster viene eseguito per più di un'ora, OCI continua a inviare record di utilizzo ogni cinque minuti fino all'eliminazione del cluster.