Kompatible Meta-Modelle

Sie können große Sprachmodelle aus Hugging Face- und OCI Object Storage-Buckets in OCI Generative AI importieren, Endpunkte für diese Modelle erstellen und im generativen KI-Service verwenden.

Hinweis

Bevor Sie ein Modell auswählen, lesen Sie die Anleitung nach den Modelltabellen auf dieser Seite, um eine kompatible Hardwareeinheitsausprägung auszuwählen und die Abrechnung für dedizierte KI-Cluster zu verstehen, die importierte Modelle hosten.

Meta Llama

Die folgenden Modelle sind eine verbesserte Version von Meta Llama-Modellen mit Grouped Query Attention (GQA). Weitere Informationen finden Sie in Llama 3.3 und Llama 4 in der Hugging Face-Dokumentation.

Kompatible Meta Llama-Modelle
Hugging Face-Modell-ID Modellfähigkeit Minimale Ausprägung der dedizierten KI-Clustereinheit
meta-llama/Llama-4-Maverick-17B-128E-Instruct-FP8 IMAGE_TEXT_TO_TEXT H100_X8
meta-llama/Llama-4-Scout-17B-16E-Instanz IMAGE_TEXT_TO_TEXT H100_X4
meta-llama/Llama-3.3-70B-Instanz TEXT_TO_TEXT A100_80G_X4
meta-llama/Llama-3.2-3B-Instanz TEXT_TO_TEXT A100_80G_X1
meta-llama/Llama-3.2-1B-Instanz TEXT_TO_TEXT A100_80G_X1
meta-llama/Llama-3.1-8B-Instanz TEXT_TO_TEXT A100_80G_X1
meta-llama/Meta-Llama-3-8B-Instanz TEXT_TO_TEXT A100_80G_X1
meta-llama/Meta-Llama-3-70B-Instanz TEXT_TO_TEXT A100_80G_X4
meta-llama/Llama-2-70b-chat-hf TEXT_TO_TEXT A100_80G_X4
meta-llama/Llama-2-13b-chat-hf TEXT_TO_TEXT A100_80G_X1
meta-llama/Llama-2-7b-chat-hf TEXT_TO_TEXT A100_80G_X1
Wichtig

  • Bei importierten Modellen können Sie die vom Modellprovider angegebene native Kontextlänge verwenden. Die effektive maximale Kontextlänge wird jedoch durch das zugrunde liegende Hardwaresetup begrenzt, das Sie für das Hosting dedizierter KI-Cluster in OCI Generative AI auswählen. Um die native Kontextlänge eines Modells voll auszuschöpfen, müssen Sie möglicherweise mehr Hardwareressourcen bereitstellen.
  • Fein abgestimmte Modellanforderungen

    Sie können die auf dieser Seite aufgeführten unterstützten Basismodelle außerhalb von OCI Generative AI optimieren und die resultierenden Modelle importieren, wenn sie die folgenden Anforderungen erfüllen:

    • Das optimierte Modell muss dieselbe Transformatorversion wie das unterstützte Basismodell verwenden.
    • Die Gesamtzahl der Parameter muss innerhalb von ±10% des ursprünglichen Basismodells liegen.

    Für Modelle, die mit LoRA optimiert wurden:

    • Führen Sie vor dem Deployment die Adaptergewichtungen LoRA mit dem Basismodell zusammen.
    • Sie können die Gewichtungen automatisch mit PEFT oder einem ähnlichen Repository oder Tool zusammenführen.
    • Durch die Zusammenführung wird das Modell für die Serviermaschine transparent und bietet die beste Leistung.
    • Jedes optimierte Modell kann die zusammengeführten Gewichtungen von nur einem LoRA-Adapter enthalten.
  • Um zu entscheiden, wo Sie ein importiertes Modell hosten können, suchen Sie in der Tabelle auf dieser Seite eine kompatible Einheitenausprägung für das Modell, und bestätigen Sie dann, dass die Hardwareausprägung in der Zielregion unter Hardwareeinheitenausprägungen nach Region verfügbar ist. Ein Modell kann nur dann in einer Region gehostet werden, wenn die Region eine für dieses Modell aufgeführte Hardwareausprägung bereitstellt.
  • Die Schritte zum Deployment der importierten Modelle finden Sie unter Importierte Modelle verwalten.
Hinweis

Fakturierung für dedizierte KI-Cluster, die importierte Modelle hosten

Dedizierte KI-Cluster, die importierte Modelle hosten, erfordern nicht die Mindestverpflichtung von 744 Einheiten, die für dedizierte KI-Cluster gilt, die vortrainierte Modelle in OCI Generative AI hosten. Stattdessen hat ein dediziertes KI-Cluster mit importiertem Modell eine fakturierbare Mindestdauer von einer Stunde. Beispiel: Ein Cluster, das eine KI-Einheit verwendet und 30 Minuten lang ausgeführt wird, wird eine KI-Einheitsstunde in Rechnung gestellt.

Nach der ersten Stunde basieren die Gebühren auf der tatsächlichen Laufzeit des Clusters und werden anteilig auf die Millisekunde verteilt. Beispiel: Ein Cluster, das eine Stunde und eine Minute lang ausgeführt wird, wird für diese Dauer statt für zwei volle Stunden in Rechnung gestellt.

OCI sendet Nutzungsdatensätze alle fünf Minuten an Metering and Billing, während das Cluster ausgeführt wird. Wenn das Cluster gelöscht wird, bevor das einstündige Minimum erreicht ist, meldet OCI weiterhin abrechenbare Nutzung, bis das Minimum erreicht ist. Wenn das Cluster mehr als eine Stunde lang ausgeführt wird, sendet OCI weiterhin alle fünf Minuten Nutzungsdatensätze, bis das Cluster gelöscht wird.