Modellendpunkte verwalten
Verwenden Sie Modellendpunkte, um Inferenzanforderungen an vortrainierte, benutzerdefinierte oder importierte Modelle zu senden, die auf dedizierten KI-Clustern in OCI Generative AI gehostet werden.
Ein Modellendpunkt ist ein separat benannter Zugriffspunkt, bei dem ein Modell Inferenzanforderungen akzeptiert und Antworten zurückgibt. Sie erstellen einen Modellendpunkt auf einem dedizierten Hosting-KI-Cluster. Für ein Modell, das im On-Demand-Modus gehostet wird, ist kein Modellendpunkt in einem dedizierten KI-Cluster erforderlich.
So verwenden Modellendpunkte ein Hostingcluster
Ein dediziertes KI-Hostcluster muss mindestens ein Modellreplikat enthalten. Modellreplikate verwenden dedizierte KI-Einheiten und stellen die Compute-Ressourcen für Inferenz bereit. Modellendpunkte verwenden die Modell- und Compute-Ressourcen, die im Cluster bereitgestellt werden.
Durch das Erstellen zusätzlicher Modellendpunkte werden keine Modellreplikate hinzugefügt oder der Inferenzdurchsatz des Clusters erhöht. Um den Durchsatz zu erhöhen, fügen Sie dem Hostingcluster Modellreplikate hinzu.
Wenn Sie ein Hostingcluster erstellen, wählen Sie ein vortrainiertes Basismodell, das Basismodell für ein benutzerdefiniertes Modell oder ein bestimmtes importiertes Modell aus. Das von einem Endpunkt verwendete Modell muss mit dieser Clusterauswahl und ihrer Einheitenausprägung kompatibel sein. Nicht verknüpfte Modelle können nicht dasselbe Cluster gemeinsam verwenden. Modellspezifische Endpunkt- und Clusterkompatibilität finden Sie auf der entsprechenden Modellseite.
Für das Hosting von Clustern für importierte Modelle ist die Mindestverpflichtung von 744 Einheiten nicht erforderlich, die für das Hosting von Clustern für vortrainierte und benutzerdefinierte OCI Generative AI-Modelle gilt. Diese Abrechnungsdifferenz entfernt nicht die Anforderung, einen Modellendpunkt für den Zugriff auf ein importiertes Modell zu erstellen. Siehe Hardwareeinheitsausprägungen für importierte Modelle.
Endpunktkapazität
Standardmäßig kann ein dediziertes KI-Hostcluster bis zu 50 Modellendpunkte aufweisen. Auf der Detailseite des dedizierten KI-Clusters zeigt Verbleibende Endpunktkapazität, wie viele zusätzliche Modellendpunkte das Cluster unter seinem aktuellen Limit unterstützen kann. Beispiel: Ein Cluster mit einer Kapazität von 50 und ein vorhandener Endpunkt zeigt eine verbleibende Endpunktkapazität von 49.
Sie können mehrere Endpunkte als Aliasnamen für ein kompatibles Modell erstellen und für verschiedene Benutzer, Anwendungen oder Zwecke verwenden. Sofern unterstützt, kann jeder Endpunkt über eine eigene Endpunktkonfiguration verfügen, wie öffentliche oder private Netzwerkzugriffs- und Leitplankeneinstellungen. Die Endpunkte verwenden die Compute-Ressourcen und Modellreplikate gemeinsam, die im Cluster bereitgestellt werden.
Wenn Sie keinen Endpunkt mehr benötigen, löschen Sie den Endpunkt, damit Sie die verfügbare Endpunktkapazität des Clusters für einen anderen Endpunkt verwenden können.
Fordern Sie für mehr als 50 Endpunkte in einem Hostingcluster eine Erhöhung des Servicelimits an für
endpoint-per-dedicated-unit-count. Siehe Servicelimits für generative KI.Modellendpunkte und private Endpunkte
Ein Modellendpunkt und ein privater Endpunkt dienen verschiedenen Zwecken. Ein Modellendpunkt bietet Zugriff auf ein Modell, das in einem dedizierten KI-Cluster gehostet wird. Ein privater Endpunkt stellt einen privaten Netzwerkpfad zu OCI Generative AI über ein virtuelles Cloud-Netzwerk (VCN) bereit.
Um über ein privates Netzwerk auf ein Modell in einem dedizierten KI-Cluster zuzugreifen, erstellen Sie zunächst einen privaten Endpunkt. Wenn Sie dann den Modellendpunkt im Cluster erstellen, wählen Sie den privaten Endpunkt für den Netzwerkzugriff aus.
Verwaltungsaufgaben
Nachdem Sie einen aktiven Endpunkt für ein benutzerdefiniertes oder importiertes Modell erstellt haben, ist das Modell in der Modellliste des Playgrounds verfügbar.
Sie können die folgenden Aufgaben ausführen, um Modellendpunkte zu erstellen und verwalten: