Kompatible MiniMax-Modelle
Sie können große Sprachmodelle aus Hugging Face- und OCI Object Storage-Buckets in OCI Generative AI importieren, Endpunkte für diese Modelle erstellen und sie im Generative AI-Service verwenden.
Bevor Sie ein Modell auswählen, lesen Sie die Anleitung nach den Modelltabellen auf dieser Seite, um eine kompatible Hardwareeinheitsausprägung auszuwählen und die Abrechnung für dedizierte KI-Cluster zu verstehen, die importierte Modelle hosten.
MiniMax M3
Das Modell MiniMax-M3-MXFP8 ist die quantisierte MXFP8-Variante von MiniMax M3, einem nativen multimodalen Modell mit einem Tokenkontext von einer Million. Das Modell verfügt über rund 428 Milliarden Gesamtparameter mit rund 23 Milliarden aktivierten Parametern und nutzt MiniMax Sparse Attention (MSA) für eine effiziente Weiterverarbeitung. Dieses Modell ist für Codierung, agentenbezogene Workflows mit langem Horizont und kollaborative Produktivitätsaufgaben optimiert.
| Hugging Face-Modell-ID | Modellfähigkeit | Minimale Ausprägung der dedizierten KI-Clustereinheit |
|---|---|---|
| MiniMaxAI/MiniMax-M3-MXFP8 | TEXT_ZU_TEXT |
|
MiniMax M2
Die Text-zu-Text-Modelle von MiniMax M2 sind für Codierung, komplexe Argumentation und agentenbezogene Workflows wie Werkzeugnutzung, Suche und Produktivitätsaufgaben optimiert. MiniMax-M2 ist ein Mixture-of-Experts (MoE)-Modell, das für effiziente Codierung und Agentenleistung entwickelt wurde, und spätere MiniMax-M2-Modelle erweitern diesen Fokus auf fortschrittlichere Software-Engineering- und Professional-Work-Aufgaben. Weitere Informationen finden Sie unter MiniMax in der Hugging Face-Dokumentation.
| Hugging Face-Modell-ID | Modellfähigkeit | Minimale Ausprägung der dedizierten KI-Clustereinheit |
|---|---|---|
| MiniMaxAI/MiniMax-M2.7 | TEXT_ZU_TEXT |
|
| MiniMaxAI/MiniMax-M2.5 | TEXT_ZU_TEXT |
|
| MiniMaxAI/MiniMax-M2 | TEXT_ZU_TEXT |
|
- Bei importierten Modellen können Sie die vom Modellprovider angegebene native Kontextlänge verwenden. Die effektive maximale Kontextlänge wird jedoch durch das zugrunde liegende Hardwaresetup begrenzt, das Sie für das Hosting dedizierter KI-Cluster in OCI Generative AI auswählen. Um die native Kontextlänge eines Modells voll auszuschöpfen, müssen Sie möglicherweise mehr Hardwareressourcen bereitstellen.
- Fein abgestimmte Modellanforderungen
Sie können die auf dieser Seite aufgeführten unterstützten Basismodelle außerhalb von OCI Generative AI optimieren und die resultierenden Modelle importieren, wenn sie die folgenden Anforderungen erfüllen:
- Das optimierte Modell muss dieselbe Transformatorversion wie das unterstützte Basismodell verwenden.
- Die Gesamtzahl der Parameter muss innerhalb von ±10% des ursprünglichen Basismodells liegen.
Für Modelle, die mit
LoRAoptimiert wurden:- Führen Sie vor dem Deployment die Adaptergewichtungen
LoRAmit dem Basismodell zusammen. - Sie können die Gewichtungen automatisch mit PEFT oder einem ähnlichen Repository oder Tool zusammenführen.
- Durch die Zusammenführung wird das Modell für die Serviermaschine transparent und bietet die beste Leistung.
- Jedes optimierte Modell kann die zusammengeführten Gewichtungen von nur einem
LoRA-Adapter enthalten.
- Um zu entscheiden, wo Sie ein importiertes Modell hosten können, suchen Sie in der Tabelle auf dieser Seite eine kompatible Einheitenausprägung für das Modell, und bestätigen Sie dann, dass die Hardwareausprägung in der Zielregion unter Hardwareeinheitenausprägungen nach Region verfügbar ist. Ein Modell kann nur dann in einer Region gehostet werden, wenn die Region eine für dieses Modell aufgeführte Hardwareausprägung bereitstellt.
- Die Schritte zum Deployment der importierten Modelle finden Sie unter Importierte Modelle verwalten.
Fakturierung für dedizierte KI-Cluster, die importierte Modelle hosten
Dedizierte KI-Cluster, die importierte Modelle hosten, erfordern nicht die Mindestverpflichtung von 744 Einheiten, die für dedizierte KI-Cluster gilt, die vortrainierte Modelle in OCI Generative AI hosten. Stattdessen hat ein dediziertes KI-Cluster mit importiertem Modell eine fakturierbare Mindestdauer von einer Stunde. Beispiel: Ein Cluster, das eine KI-Einheit verwendet und 30 Minuten lang ausgeführt wird, wird eine KI-Einheitsstunde in Rechnung gestellt.
Nach der ersten Stunde basieren die Gebühren auf der tatsächlichen Laufzeit des Clusters und werden anteilig auf die Millisekunde verteilt. Beispiel: Ein Cluster, das eine Stunde und eine Minute lang ausgeführt wird, wird für diese Dauer statt für zwei volle Stunden in Rechnung gestellt.
OCI sendet Nutzungsdatensätze alle fünf Minuten an Metering and Billing, während das Cluster ausgeführt wird. Wenn das Cluster gelöscht wird, bevor das einstündige Minimum erreicht ist, meldet OCI weiterhin abrechenbare Nutzung, bis das Minimum erreicht ist. Wenn das Cluster mehr als eine Stunde lang ausgeführt wird, sendet OCI weiterhin alle fünf Minuten Nutzungsdatensätze, bis das Cluster gelöscht wird.