モデル・エンドポイントの管理
モデル・エンドポイントを使用して、OCI生成AIの専用AIクラスタでホストされている事前トレーニング済モデル、カスタム・モデルまたはインポート済モデルに推論リクエストを送信します。
モデル・エンドポイントは、モデルが推論リクエストを受け入れてレスポンスを返す個別の名前付きアクセス・ポイントです。ホスティング専用AIクラスタにモデル・エンドポイントを作成します。オンデマンド・モードでホストされるモデルには、専用AIクラスタ上のモデル・エンドポイントは必要ありません。
モデル・エンドポイントによるホスティング・クラスタの使用方法
ホスティング専用AIクラスタには、少なくとも1つのモデル・レプリカが必要です。モデル・レプリカでは専用のAIユニットが使用され、推論のためのコンピュート・リソースが提供されます。モデル・エンドポイントは、クラスタにプロビジョニングされたモデルおよびコンピュート・リソースを使用します。
追加のモデル・エンドポイントを作成しても、モデル・レプリカの追加やクラスタの推論スループットの向上は行われません。スループットを向上させるには、モデル・レプリカをホスト・クラスタに追加します。
ホスティング・クラスタを作成する場合は、事前トレーニング済ベース・モデル、カスタム・モデルのベース・モデルまたは特定のインポート済モデルを選択します。エンドポイントで使用されるモデルは、そのクラスタ選択とそのユニット・シェイプと互換性がある必要があります。関連のないモデルは、同じクラスタを共有できません。モデル固有のエンドポイントとクラスタの互換性については、該当するモデル・ページを参照してください。
インポートされたモデルのクラスタをホスティングする場合、OCI Generative AIの事前トレーニング済モデルおよびカスタム・モデルのホスティング・クラスタに適用される744単位の最小コミットメントは必要ありません。この請求差異によって、インポートされたモデルにアクセスするためのモデル・エンドポイントの作成要件が削除されることはありません。Hardware Unit Shapes for Imported Modelsを参照してください。
エンドポイントの容量
デフォルトでは、ホスティング専用AIクラスタには最大50個のモデル・エンドポイントを含めることができます。専用AIクラスタの詳細ページの「残りのエンドポイント容量」には、クラスタが現在の制限の下でサポートできる追加のモデル・エンドポイントの数が表示されます。たとえば、容量が50で、既存のエンドポイントが1つあるクラスタは、残りのエンドポイント容量が49であることを示します。
複数のエンドポイントを互換性のあるモデルの別名として作成し、それらを様々なユーザー、アプリケーションまたは目的に使用できます。サポートされる場合、各エンドポイントは、パブリックまたはプライベートのネットワーク・アクセスやガードレール設定など、独自のエンドポイント構成を持つことができます。エンドポイントは、クラスタにプロビジョニングされたコンピュート・リソースおよびモデル・レプリカを共有します。
エンドポイントが不要になった場合は、エンドポイントを削除して、別のエンドポイントでクラスタの使用可能なエンドポイント容量を使用できるようにします。
ホスティング・クラスタ上の50を超えるエンドポイントの場合、
endpoint-per-dedicated-unit-countのサービス制限の引上げをリクエストします。生成AIのサービス制限を参照してください。モデル・エンドポイントおよびプライベート・エンドポイント
モデル・エンドポイントとプライベート・エンドポイントの用途は異なります。モデル・エンドポイントは、専用AIクラスタでホストされているモデルへのアクセスを提供します。プライベート・エンドポイントは、仮想クラウド・ネットワーク(VCN)を介してOCI生成AIへのプライベート・ネットワーク・パスを提供します。
プライベート・ネットワークを介して専用AIクラスタ上のモデルにアクセスするには、まずプライベート・エンドポイントを作成します。次に、クラスタにモデル・エンドポイントを作成するときに、ネットワーク・アクセス用のプライベート・エンドポイントを選択します。
管理タスク
カスタム・モデルまたはインポート済モデルのアクティブなエンドポイントを作成すると、モデルはプレイグラウンドのモデル・リストで使用可能になります。
次のタスクを実行して、モデル・エンドポイントを作成および管理できます: