Kompatible Alibaba Modelle

Sie können große Sprachmodelle aus Hugging Face- und OCI Object Storage-Buckets in OCI Generative AI importieren, Endpunkte für diese Modelle erstellen und im generativen KI-Service verwenden.

Hinweis

Bevor Sie ein Modell auswählen, lesen Sie die Anleitung nach den Modelltabellen auf dieser Seite, um eine kompatible Hardwareeinheitsausprägung auszuwählen und die Abrechnung für dedizierte KI-Cluster zu verstehen, die importierte Modelle hosten.

Alibaba Qwen Modellfamilie, verfügen über erweiterte mehrsprachige und multimodale Funktionen. Modellkarten in Hugging Face finden Sie unter den Links in den folgenden Tabellen.

Qwen 3 Next

Kompatibles Qwen 3 Next-Modell
Hugging Face-Modell-ID Modellfähigkeit Minimale Ausprägung der dedizierten KI-Clustereinheit
Qwen/Qwen3-Next-80B-A3B-Instruct TEXT_TO_TEXT
  • A100_80G_X4
  • H100_X4
  • H200_X4

Qwen 3.8

Kompatible Qwen 3.8-Modelle
Hugging Face-Modell-ID Modellfähigkeit Minimale Ausprägung der dedizierten KI-Clustereinheit
Qwen/Qwen3.8-27B IMAGE_TEXT_TO_TEXT
  • A100_40G_X2
  • A100_80G_X1
  • H100_X1
  • H200_X1
  • B200_X1
  • B300_X1
Qwen/Qwen3.8-2.4T-A95B-FP8 TEXT_TO_TEXT
  • B200_X16

Qwen 3.6

Kompatibles Qwen 3.6-Modell
Hugging Face-Modell-ID Modellfähigkeit Minimale Ausprägung der dedizierten KI-Clustereinheit
Qwen/Qwen3.6-35B-A3B IMAGE_TEXT_TO_TEXT
  • A100_80G_X2
  • H100_X2
  • H200_X1
  • B200_X1
Hinweis

Nachdem Sie Qwen/Qwen3.6-35B-A3B importiert und einen Endpunkt für das Modell in einem dedizierten KI-Hostcluster erstellt haben, können Sie das Modell über die OCI-Antwort-API aufrufen. Die vollständige Liste der Chatmodelle, die für die Antwort-API verfügbar sind, finden Sie unter Verfügbare Modelle.

Qwen 3.5

Kompatibles Qwen 3.5-Modell
Hugging Face-Modell-ID Modellfähigkeit Minimale Ausprägung der dedizierten KI-Clustereinheit
Qwen/Qwen3.5-397B-A17B IMAGE_TEXT_TO_TEXT
  • H200_X8
  • B200_X8
  • B300_X4
Qwen/Qwen3.5-9B IMAGE_TEXT_TO_TEXT
  • A100_80GB_X1
  • H100_X1
  • H200_X1
  • B200_X1

Qwen-Bild

Kompatible Qwen Image-Modelle
Hugging Face-Modell-ID Modellfähigkeit Minimale Ausprägung der dedizierten KI-Clustereinheit
Qwen/Qwen-Bild TEXT_TO_IMAGE A100_80G_X1
Qwen/Qwen-Image-Bearbeiten IMAGE_TEXT_TO_IMAGE A100_80G_X1
Qwen/Qwen-Bild-2512 TEXT_TO_IMAGE A100_80G_X1
Qwen/Qwen-Image-Edit-2511 IMAGE_TEXT_TO_IMAGE A100_80G_X1
Qwen/Qwen-Image-Edit-2509 IMAGE_TEXT_TO_IMAGE A100_80G_X1
Hinweis

  • response_format: "url" funktioniert nicht und gibt einen HTTP 400-Fehler bei einer ungültigen Anforderung zurück.
  • n (Anzahl der Images): Nur 0 oder 1 funktionieren.
  • Streaming ist nicht kompatibel.
  • Nicht standardmäßige Bildgrößen können gerundet werden (z.B. 999x999 → 992x992), anstatt eine HTTP 400 (im Gegensatz zur OpenAI-API) zurückzugeben.
  • Transparenz funktioniert möglicherweise aufgrund von Modellbeschränkungen nicht.

Qwen Q (Grundsatz)

Kompatible Qwen Q-Modelle
Hugging Face-Modell-ID Modellfähigkeit Minimale Ausprägung der dedizierten KI-Clustereinheit
Qwen/QwQ-32B TEXT_TO_TEXT A100_80G_X2

Qwen 3

Kompatible Qwen 3-Modelle
Hugging Face-Modell-ID Modellfähigkeit Minimale Ausprägung der dedizierten KI-Clustereinheit
Qwen/Qwen3-Einbettung-0.6B EINBETTEN A10_X1
Qwen/Qwen3-Einbettung-4B EINBETTEN A10_X2
Qwen/Qwen3-Einbettung-8B EINBETTEN A100_80G_X1
Qwen/Qwen3-0.6B TEXT_TO_TEXT A100_80G_X1
Qwen/Qwen3-1.7B TEXT_TO_TEXT A100_80G_X1
Qwen/Qwen3-4B TEXT_TO_TEXT A100_80G_X1
Qwen/Qwen3-8B TEXT_TO_TEXT A100_80G_X1
Qwen/Qwen3-14B TEXT_TO_TEXT A100_80G_X1
Qwen/Qwen3-32B TEXT_TO_TEXT A100_80G_X2
Qwen/Qwen3-4B-Instanz-2507 TEXT_TO_TEXT A100_80G_X1
Qwen/Qwen3-30B-A3B-Instanz-2507 TEXT_TO_TEXT A100_80G_X2
Qwen/Qwen3-235B-A22B-Instanz-2507 TEXT_TO_TEXT H100_X8
Qwen/Qwen3-VL-30B-A3B-Instanz IMAGE_TEXT_TO_TEXT H100_X2
Qwen/Qwen3-VL-30B-A3B-Instanz-FP8 IMAGE_TEXT_TO_TEXT
  • H100_X2
  • H200_X2
Qwen/Qwen3-VL-235B-A22B-Instanz IMAGE_TEXT_TO_TEXT H100_X8

Qwen 2,5

Kompatible Qwen2.5-Modelle
Hugging Face-Modell-ID Modellfähigkeit Minimale Ausprägung der dedizierten KI-Clustereinheit
Qwen/Qwen2.5-Coder-32B-Instruct TEXT_TO_TEXT A100_80G_X2
Qwen/Qwen2.5-0.5B-Instanz TEXT_TO_TEXT A100_80G_X1
Qwen/Qwen2.5-1.5B-Instanz TEXT_TO_TEXT A100_80G_X1
Qwen/Qwen2.5-3B-Instanz TEXT_TO_TEXT A100_80G_X1
Qwen/Qwen2.5-7B-Instanz TEXT_TO_TEXT A100_80G_X1
Qwen/Qwen2.5-14B-Instanz TEXT_TO_TEXT A100_80G_X1
Qwen/Qwen2.5-32B-Instanz TEXT_TO_TEXT A100_80G_X2
Qwen/Qwen2.5-72B-Instanz TEXT_TO_TEXT A100_80G_X4
Qwen/Qwen2.5-VL-3B-Instanz IMAGE_TEXT_TO_TEXT A100_80G_X1
Qwen/Qwen2.5-VL-7B-Instanz IMAGE_TEXT_TO_TEXT A100_80G_X1
Qwen/Qwen2.5-VL-32B-Instanz IMAGE_TEXT_TO_TEXT A100_80G_X2
Qwen/Qwen2.5-VL-72B-Instanz IMAGE_TEXT_TO_TEXT A100_80G_X4

Qwen 2

Kompatible Qwen2-Modelle
Hugging Face-Modell-ID Modellfähigkeit Minimale Ausprägung der dedizierten KI-Clustereinheit
Qwen/Qwen2-0.5B-Instanz TEXT_TO_TEXT A100_80G_X1
Qwen/Qwen2-1.5B-Instanz TEXT_TO_TEXT A100_80G_X1
Qwen/Qwen2-7B-Instanz TEXT_ZU_TEXT A100_80G_X1
Qwen/Qwen2-72B-Instanz TEXT_ZU_TEXT A100_80G_X4
Qwen/Qwen2-VL-2B-Instanz IMAGE_TEXT_TO_TEXT A100_80G_X1
Qwen/Qwen2-VL-7B-Instanz IMAGE_TEXT_TO_TEXT A100_80G_X1
Qwen/Qwen2-VL-72B-Instanz IMAGE_TEXT_TO_TEXT A100_80G_X4
Wichtig

  • Bei importierten Modellen können Sie die vom Modellprovider angegebene native Kontextlänge verwenden. Die effektive maximale Kontextlänge wird jedoch durch das zugrunde liegende Hardwaresetup begrenzt, das Sie für das Hosting dedizierter KI-Cluster in OCI Generative AI auswählen. Um die native Kontextlänge eines Modells voll auszuschöpfen, müssen Sie möglicherweise mehr Hardwareressourcen bereitstellen.
  • Fein abgestimmte Modellanforderungen

    Sie können die auf dieser Seite aufgeführten unterstützten Basismodelle außerhalb von OCI Generative AI optimieren und die resultierenden Modelle importieren, wenn sie die folgenden Anforderungen erfüllen:

    • Das optimierte Modell muss dieselbe Transformatorversion wie das unterstützte Basismodell verwenden.
    • Die Gesamtzahl der Parameter muss innerhalb von ±10% des ursprünglichen Basismodells liegen.

    Für Modelle, die mit LoRA optimiert wurden:

    • Führen Sie vor dem Deployment die Adaptergewichtungen LoRA mit dem Basismodell zusammen.
    • Sie können die Gewichtungen automatisch mit PEFT oder einem ähnlichen Repository oder Tool zusammenführen.
    • Durch die Zusammenführung wird das Modell für die Serviermaschine transparent und bietet die beste Leistung.
    • Jedes optimierte Modell kann die zusammengeführten Gewichtungen von nur einem LoRA-Adapter enthalten.
  • Um zu entscheiden, wo Sie ein importiertes Modell hosten können, suchen Sie in der Tabelle auf dieser Seite eine kompatible Einheitenausprägung für das Modell, und bestätigen Sie dann, dass die Hardwareausprägung in der Zielregion unter Hardwareeinheitenausprägungen nach Region verfügbar ist. Ein Modell kann nur dann in einer Region gehostet werden, wenn die Region eine für dieses Modell aufgeführte Hardwareausprägung bereitstellt.
  • Die Schritte zum Deployment der importierten Modelle finden Sie unter Importierte Modelle verwalten.
Hinweis

Fakturierung für dedizierte KI-Cluster, die importierte Modelle hosten

Dedizierte KI-Cluster, die importierte Modelle hosten, erfordern nicht die Mindestverpflichtung von 744 Einheiten, die für dedizierte KI-Cluster gilt, die vortrainierte Modelle in OCI Generative AI hosten. Stattdessen hat ein dediziertes KI-Cluster mit importiertem Modell eine fakturierbare Mindestdauer von einer Stunde. Beispiel: Ein Cluster, das eine KI-Einheit verwendet und 30 Minuten lang ausgeführt wird, wird eine KI-Einheitsstunde in Rechnung gestellt.

Nach der ersten Stunde basieren die Gebühren auf der tatsächlichen Laufzeit des Clusters und werden anteilig auf die Millisekunde verteilt. Beispiel: Ein Cluster, das eine Stunde und eine Minute lang ausgeführt wird, wird für diese Dauer statt für zwei volle Stunden in Rechnung gestellt.

OCI sendet Nutzungsdatensätze alle fünf Minuten an Metering and Billing, während das Cluster ausgeführt wird. Wenn das Cluster gelöscht wird, bevor das einstündige Minimum erreicht ist, meldet OCI weiterhin abrechenbare Nutzung, bis das Minimum erreicht ist. Wenn das Cluster mehr als eine Stunde lang ausgeführt wird, sendet OCI weiterhin alle fünf Minuten Nutzungsdatensätze, bis das Cluster gelöscht wird.