Kompatible Google-Modelle

Sie können große Sprachmodelle aus Hugging Face- und OCI Object Storage-Buckets in OCI Generative AI importieren, Endpunkte für diese Modelle erstellen und im generativen KI-Service verwenden.

Hinweis

Bevor Sie ein Modell auswählen, lesen Sie die Anleitung nach den Modelltabellen auf dieser Seite, um eine kompatible Hardwareeinheitsausprägung auszuwählen und die Abrechnung für dedizierte KI-Cluster zu verstehen, die importierte Modelle hosten.

Details zu Modellen finden Sie unter den folgenden Links:

MedGemma

Google MedGemma 27B Text IT ist ein Sprachmodell mit 27 Milliarden Parametern, das auf der Gemma 3-Architektur basiert. Das Modell, das auf medizinische Literatur und klinische Unterlagen trainiert ist, ist anweisungsoptimiert (IT), sodass Benutzeranfragen besser verfolgt und Aufgaben im Gesundheitswesen wie die Beantwortung medizinischer Fragen, die klinische Unterstützung und die Zusammenfassung durchgeführt werden können.

Kompatibles MedGemma-Modell
Hugging Face-Modell-ID Modellfähigkeit Minimale Ausprägung der dedizierten KI-Clustereinheit
google/medgemma-27b-text-it TEXT_TO_TEXT
  • A100_80GB_X2
  • H100_X2
  • H200_X1
  • B200_X1

Gemma

Gemma 4 26B A4B IT unterstützt Text-, Bild- und kombinierte Bild- und Texteingaben über die Funktion IMAGE_TEXT_TO_TEXT und generiert Text. Für dieses Modell wird in der Tabelle die kleinste unterstützte Ausprägung der dedizierten KI-Clustereinheit in jeder unterstützten Accelerator-Klasse aufgeführt.

Kompatible Gemma-Modelle
Hugging Face-Modell-ID Modellfähigkeit Minimale Ausprägung der dedizierten KI-Clustereinheit
google/gemma-4-26B-A4B-it IMAGE_TEXT_TO_TEXT
  • A10_X4
  • A100_40GB_X2
  • A100_80GB_X1
  • H100_X1
  • H200_X1
  • B200_X1
google/gemma-4-31b-it TEXT_TO_TEXT
  • A100_40G_X4
  • A100_80G_X2
  • H100_X2
  • H200_X1
  • B200_X1
google/gemma-4-12B-it IMAGE_TEXT_TO_TEXT
  • A100_40G_X1
  • A100_80G_X1
  • H100_X1
  • H200_X1
  • B200_X1
google/gemma-4-26B-A4B IMAGE_TEXT_TO_TEXT
  • A10_X4
  • A100_40G_X2
  • A100_80G_X1
  • H100_X1
  • H200_X1
  • B200_X1
google/gemma-3-4b-it IMAGE_TEXT_TO_TEXT A100_80G_X1
google/gemma-3-270m-it TEXT_TO_TEXT A100_80G_X1
google/gemma-3-27b-it IMAGE_TEXT_TO_TEXT A100_80G_X2
google/gemma-3-12b-it IMAGE_TEXT_TO_TEXT
  • A100_40G_X4
  • A100_80G_X1
  • H100_X2
  • H200_X1
google/gemma-3-1b-it TEXT_TO_TEXT A100_80G_X1
google/gemma-2-9b-it TEXT_TO_TEXT A100_80G_X1
google/gemma-2-27b-it TEXT_ZU_TEXT A100_80G_X2
google/gemma-2-2b-it TEXT_ZU_TEXT A100_80G_X1
Hinweis

Nachdem Sie google/gemma-4-31b-it importiert und einen Endpunkt für das Modell in einem dedizierten KI-Hostcluster erstellt haben, können Sie das Modell über die OCI-Antwort-API aufrufen. Die vollständige Liste der Chatmodelle, die für die Antwort-API verfügbar sind, finden Sie unter Verfügbare Modelle.

Wichtig

  • Bei importierten Modellen können Sie die vom Modellprovider angegebene native Kontextlänge verwenden. Die effektive maximale Kontextlänge wird jedoch durch das zugrunde liegende Hardwaresetup begrenzt, das Sie für das Hosting dedizierter KI-Cluster in OCI Generative AI auswählen. Um die native Kontextlänge eines Modells voll auszuschöpfen, müssen Sie möglicherweise mehr Hardwareressourcen bereitstellen.
  • Fein abgestimmte Modellanforderungen

    Sie können die auf dieser Seite aufgeführten unterstützten Basismodelle außerhalb von OCI Generative AI optimieren und die resultierenden Modelle importieren, wenn sie die folgenden Anforderungen erfüllen:

    • Das optimierte Modell muss dieselbe Transformatorversion wie das unterstützte Basismodell verwenden.
    • Die Gesamtzahl der Parameter muss innerhalb von ±10% des ursprünglichen Basismodells liegen.

    Für Modelle, die mit LoRA optimiert wurden:

    • Führen Sie vor dem Deployment die Adaptergewichtungen LoRA mit dem Basismodell zusammen.
    • Sie können die Gewichtungen automatisch mit PEFT oder einem ähnlichen Repository oder Tool zusammenführen.
    • Durch die Zusammenführung wird das Modell für die Serviermaschine transparent und bietet die beste Leistung.
    • Jedes optimierte Modell kann die zusammengeführten Gewichtungen von nur einem LoRA-Adapter enthalten.
  • Um zu entscheiden, wo Sie ein importiertes Modell hosten können, suchen Sie in der Tabelle auf dieser Seite eine kompatible Einheitenausprägung für das Modell, und bestätigen Sie dann, dass die Hardwareausprägung in der Zielregion unter Hardwareeinheitenausprägungen nach Region verfügbar ist. Ein Modell kann nur dann in einer Region gehostet werden, wenn die Region eine für dieses Modell aufgeführte Hardwareausprägung bereitstellt.
  • Die Schritte zum Deployment der importierten Modelle finden Sie unter Importierte Modelle verwalten.
Hinweis

Fakturierung für dedizierte KI-Cluster, die importierte Modelle hosten

Dedizierte KI-Cluster, die importierte Modelle hosten, erfordern nicht die Mindestverpflichtung von 744 Einheiten, die für dedizierte KI-Cluster gilt, die vortrainierte Modelle in OCI Generative AI hosten. Stattdessen hat ein dediziertes KI-Cluster mit importiertem Modell eine fakturierbare Mindestdauer von einer Stunde. Beispiel: Ein Cluster, das eine KI-Einheit verwendet und 30 Minuten lang ausgeführt wird, wird eine KI-Einheitsstunde in Rechnung gestellt.

Nach der ersten Stunde basieren die Gebühren auf der tatsächlichen Laufzeit des Clusters und werden anteilig auf die Millisekunde verteilt. Beispiel: Ein Cluster, das eine Stunde und eine Minute lang ausgeführt wird, wird für diese Dauer statt für zwei volle Stunden in Rechnung gestellt.

OCI sendet Nutzungsdatensätze alle fünf Minuten an Metering and Billing, während das Cluster ausgeführt wird. Wenn das Cluster gelöscht wird, bevor das einstündige Minimum erreicht ist, meldet OCI weiterhin abrechenbare Nutzung, bis das Minimum erreicht ist. Wenn das Cluster mehr als eine Stunde lang ausgeführt wird, sendet OCI weiterhin alle fünf Minuten Nutzungsdatensätze, bis das Cluster gelöscht wird.