22 ガードレール
ガードレールは、AIエージェントの動作をガイドおよび制御するための安全メカニズムです。
ノート:
AIデータ・プラットフォーム・ワークベンチで提供されるガードレールは、英語でのみ使用できます。AIデータ・プラットフォーム・ワークベンチで提供されるガードレールは、OCI生成AIサービス・チームによって実装されます。Guardrails for OCI Generative AIを参照してください。ガードレール構成に基づいて、AIデータ・プラットフォーム・ワークベンチ・サービスによって、OCIテナンシ内のガードレールAPIの適用が起動されます。
ビジュアル・フロー・キャンバスのガードレール
デフォルトでは、モデル・プロバイダのネイティブ・セーフティ・コントロールを超えるガードレールはシステムに適用されません。ガードレールを追加するには、エージェント・ビジュアル・フロー・ビルダーにガードレール・ノードをドラッグし、エージェントに接続する必要があります。
ガードレール・ノードは、チャット・トリガーとエージェント・ノード間、スーパーバイザとエグゼキュータ・エージェント間、またはエージェントとツール・ノード間のトラフィックをフィルタできます。ほとんどのシナリオでは、chatトリガーとエージェント・ノードの間に単一のガードレール・ノードを推奨します。これにより、受信ユーザーからのメッセージおよびエージェントによって生成されたメッセージがガードレールでフィルタされます。

- チャット・トリガー・ノードおよびエージェント(スーパーバイザまたはエグゼキュータ)
どのようなガードレールが利用できますか?
次の図は、エンド・ユーザーとエージェント間の単純な相互作用を示しています。このシナリオでは、すべてのガイドレールが適用されます(コンテンツ・モデレーション- CM、迅速な注入防止- PI、PII検出- PII)。PIはユーザークエリーにのみ適用されます。
エンド・ユーザーによって発行された2番目のメッセージの後、PI試行が検出され、エージェント開発者がPI検出(ブロック)に対して選択したアクションの後にユーザー・メッセージがブロックされました。

コンテンツ・モデレーション
コンテンツのモデレーションは、ほとんどの生成AIにおけるガードレールの一般的な実装です。チェックを外すと、LLMは有害なコンテンツを生成し、暴力的、人種差別的、性的に露骨なコンテンツを宣伝することができます。エージェント開発者は、エージェントとのユーザー・インタラクションを監視し、有害なコンテンツがないかスキャンする方法を完全に可視化し、制御することが不可欠です。コンテンツのモデレーションは、憎悪、性的、暴力的、有毒、軽蔑的、またはハラスメントベースのコンテンツがエージェントによって考慮または生成されることを防ぎます。ガードレール・モデルは、これらの6つのカテゴリに沿ってコンテンツを分類し、それらのカテゴリのいずれかに属するコンテンツにフラグを付けます。
- ブロック:エージェントがユーザー入力を処理してレスポンスを生成できないようにします。ユーザーはエージェントからエラー応答を受け取ります。
- 通知:エージェントがユーザー入力を処理してレスポンスを生成することを許可します。エージェントは、入力またはレスポンスにガードレール基準を満たすコンテンツが含まれていることをユーザーに通知します。
- 許可:エージェントによる有害なコンテンツの処理または生成(あるいはその両方)を許可します。
エージェントの作成時に、コンテンツ・モデレーションに対して「ブロック」アクションが選択されます。Oracleでは、コンテンツ・モデレーションのガードレール選択として「ブロック」を保持することをお薦めします。
プロンプトインジェクション
AIエージェントのプロンプト・インジェクション・ガードレールは、ユーザー入力に埋め込まれた悪意のある命令または意図しない命令を検出、防止および軽減する保護メカニズムです。プロンプト・インジェクション攻撃では、以前のルールの無視、シークレットの抽出、認可されていないアクションの実行をモデルに指示する隠しテキストを挿入して、エージェントの元の指示、ポリシーまたは目標をオーバーライドまたは無効化しようとします。
- ブロック:エージェントがユーザー入力を処理できないようにします。ユーザーはエージェントからエラー応答を受け取ります。
- 通知:エージェントがユーザー入力を処理することを許可します。エージェントは、入力にガードレール条件を満たすコンテンツが含まれていることをユーザーに通知します。
- 許可:エージェントによる潜在的に有害なコンテンツの処理を許可します。
「ブロック」アクションは、エージェントの作成時にプロンプト・インジェクションが選択されます。Oracleでは、プロンプト・インジェクション用のガードレール選択として「ブロック」を保持することをお薦めします。
個人の身元を特定する情報(PII)
PIIガードレールは、ユーザー入力問合せまたはエージェント・レスポンスからPIIを自動的に検出、ブロックまたはマスクします。このガードレールは、エージェントがプライバシー規制や組織ポリシーに違反する方法で機密ユーザー情報を公開することを防ぎます。
- 電話番号
- 物理アドレス
- 個人情報
- ブロック:エージェントがユーザー入力を処理してレスポンスを生成できないようにします。ユーザーはエージェントからエラー応答を受け取ります。
- 通知:エージェントがユーザー入力を処理してレスポンスを生成することを許可します。エージェントは、入力またはレスポンスにPIIが含まれていることをユーザーに通知します。
- マスク:エージェントが入力を処理し、マスクされたレスポンスを生成できるようにします。使用されるPIIは、露出を防ぐためにリダクションされます。
- 許可:エージェントによるPIIデータの処理または生成(あるいはその両方)を許可します。
新規エージェントでは、PIIはデフォルトでユーザー入力とレスポンスの両方で許可されます。Oracleでは、セキュリティ・ニーズに基づいてPIIのガードレールを慎重に選択することをお薦めします。


