Kompatible OpenAI-Modelle
Sie können kompatible Modelle aus Hugging Face- und OCI Object Storage-Buckets in OCI Generative AI importieren, Endpunkte für diese Modelle erstellen und sie im generativen KI-Service verwenden.
Bevor Sie ein Modell auswählen, lesen Sie die Anleitung nach den Modelltabellen auf dieser Seite, um eine kompatible Hardwareeinheitsausprägung auszuwählen und die Abrechnung für dedizierte KI-Cluster zu verstehen, die importierte Modelle hosten.
OpenAI Whisper
Das OpenAI Whisper Large V3 Turbo-Modell ist für automatische Spracherkennung und Audiotranskription optimiert. Dieses Audio-to-Text-Modell ist eine fein abgestimmte Version eines beschnittenen Whisper Large V3-Modells, mit weniger Decoder-Ebenen für eine schnellere Transkription mit einem geringfügigen Qualitäts-Tradeoff. Das Modell unterstützt mehrsprachige Transkription, Sprachidentifikation und Sprachübersetzung von unterstützten Sprachen in englischen Text und eignet sich für latenzempfindliche Anwendungsfälle für die Audioverarbeitung mit hohem Durchsatz. Weitere Informationen finden Sie in der Dokumentation zu Hugging Face unter OpenAI Whisper Large V3 Turbo.
| Hugging Face-Modell-ID | Modellfähigkeit | Minimale Ausprägung der dedizierten KI-Clustereinheit |
|---|---|---|
| openai/whisper-large-v3-turbo | AUDIO-TO-TEXT |
|
- Bei importierten Modellen können Sie die vom Modellprovider angegebene native Kontextlänge verwenden. Die effektive maximale Kontextlänge wird jedoch durch das zugrunde liegende Hardwaresetup begrenzt, das Sie für das Hosting dedizierter KI-Cluster in OCI Generative AI auswählen. Um die native Kontextlänge eines Modells voll auszuschöpfen, müssen Sie möglicherweise mehr Hardwareressourcen bereitstellen.
- Fein abgestimmte Modellanforderungen
Sie können die auf dieser Seite aufgeführten unterstützten Basismodelle außerhalb von OCI Generative AI optimieren und die resultierenden Modelle importieren, wenn sie die folgenden Anforderungen erfüllen:
- Das optimierte Modell muss dieselbe Transformatorversion wie das unterstützte Basismodell verwenden.
- Die Gesamtzahl der Parameter muss innerhalb von ±10% des ursprünglichen Basismodells liegen.
Für Modelle, die mit
LoRAoptimiert wurden:- Führen Sie vor dem Deployment die Adaptergewichtungen
LoRAmit dem Basismodell zusammen. - Sie können die Gewichtungen automatisch mit PEFT oder einem ähnlichen Repository oder Tool zusammenführen.
- Durch die Zusammenführung wird das Modell für die Serviermaschine transparent und bietet die beste Leistung.
- Jedes optimierte Modell kann die zusammengeführten Gewichtungen von nur einem
LoRA-Adapter enthalten.
- Um zu entscheiden, wo Sie ein importiertes Modell hosten können, suchen Sie in der Tabelle auf dieser Seite eine kompatible Einheitenausprägung für das Modell, und bestätigen Sie dann, dass die Hardwareausprägung in der Zielregion unter Hardwareeinheitenausprägungen nach Region verfügbar ist. Ein Modell kann nur dann in einer Region gehostet werden, wenn die Region eine für dieses Modell aufgeführte Hardwareausprägung bereitstellt.
- Die Schritte zum Deployment der importierten Modelle finden Sie unter Importierte Modelle verwalten.
Fakturierung für dedizierte KI-Cluster, die importierte Modelle hosten
Dedizierte KI-Cluster, die importierte Modelle hosten, erfordern nicht die Mindestverpflichtung von 744 Einheiten, die für dedizierte KI-Cluster gilt, die vortrainierte Modelle in OCI Generative AI hosten. Stattdessen hat ein dediziertes KI-Cluster mit importiertem Modell eine fakturierbare Mindestdauer von einer Stunde. Beispiel: Ein Cluster, das eine KI-Einheit verwendet und 30 Minuten lang ausgeführt wird, wird eine KI-Einheitsstunde in Rechnung gestellt.
Nach der ersten Stunde basieren die Gebühren auf der tatsächlichen Laufzeit des Clusters und werden anteilig auf die Millisekunde verteilt. Beispiel: Ein Cluster, das eine Stunde und eine Minute lang ausgeführt wird, wird für diese Dauer statt für zwei volle Stunden in Rechnung gestellt.
OCI sendet Nutzungsdatensätze alle fünf Minuten an Metering and Billing, während das Cluster ausgeführt wird. Wenn das Cluster gelöscht wird, bevor das einstündige Minimum erreicht ist, meldet OCI weiterhin abrechenbare Nutzung, bis das Minimum erreicht ist. Wenn das Cluster mehr als eine Stunde lang ausgeführt wird, sendet OCI weiterhin alle fünf Minuten Nutzungsdatensätze, bis das Cluster gelöscht wird.