22 Schutzschienen

Leitschienen sind Sicherheitsmechanismen, mit denen das Verhalten von KI-Agenten gesteuert und gesteuert wird.

In der Oracle AI Data Platform Workbench werden Guardrails konfiguriert, um die Generierung oder den Verbrauch von toxischen und böswilligen Inhalten durch Agents zu verhindern. Leitplanken verhindern auch das Auslaufen von personenbezogenen Daten (PII) durch den Agenten. Die in Ihrer AI Data Platform Workbench verfügbaren spezifischen Guardrails gelten für Inhaltsmoderation, Prompt Injection und PII.

Hinweis:

Die von der AI Data Platform Workbench angebotenen Guardrails sind nur in englischer Sprache verfügbar.

Die in der AI Data Platform Workbench angebotenen Guardrails werden vom OCI Generative AI-Serviceteam implementiert. Siehe Guardrails für OCI Generative AI. Basierend auf Ihrer Guardrails-Konfiguration ruft der AI Data Platform Workbench-Service die Apply Guardrails-API in Ihrem OCI-Mandanten auf.

Geländer in Visual Flow Canvas

Standardmäßig werden keine Leitschienen über die nativen Sicherheitskontrollen des Modellanbieters hinaus auf Ihr System angewendet. Um Leitschienen hinzuzufügen, müssen Sie einen Leitschienenknoten an den visuellen Ablaufgenerator Ihres Agent ziehen und mit dem Agent verbinden.

Ein Guardrails-Knoten kann den Datenverkehr zwischen einem Chat-Trigger und einem Agent-Knoten, zwischen einem Supervisor und Executor-Agents oder zwischen Agent- und Toolknoten filtern. In den meisten Szenarios wird ein einzelner Guardrails-Knoten zwischen dem Chattrigger und dem Agent-Knoten empfohlen. Dadurch wird sichergestellt, dass alle Nachrichten des eingehenden Benutzers und Nachrichten, die vom Agent generiert werden, über die Leitplanken gefiltert werden.


Ein Agent, der für den visuellen Builder geöffnet ist. Der Leitplankenknoten ist in der Palette hervorgehoben.

Der Leitplankenknoten kann nur zwischen folgenden Bereichen eingefügt werden:
  • Ein Chattriggerknoten und ein Agent (Supervisor oder Executor)

Welche Leitplanken sind verfügbar?

Das folgende Diagramm zeigt eine einfache Interaktion zwischen einem Endbenutzer und einem Agent. In diesem Szenario werden alle Guadrails angewendet (Inhaltsmoderation – CM, prompte Injektionsprävention – PI und PII-Erkennung – PII). PI wird nur auf die Benutzerabfrage angewendet.

Nach der zweiten vom Endbenutzer ausgegebenen Nachricht wurde ein PI-Versuch erkannt, und die Benutzernachricht wurde nach der ausgewählten Aktion des Agent-Entwicklers bei der PI-Erkennung (Block) blockiert.


Diagramm, das ein Beispiel für AI-Agent-Guardrails beschreibt

Inhaltsmoderation

Content Moderation ist eine gängige Implementierung von Leitplanken in den meisten generativen KI. Ungeprüft können LLMs schädliche Inhalte generieren, gewalttätige, rassistische und sexuell explizite Inhalte fördern. Es ist unerlässlich, Agent-Entwicklern vollständige Transparenz und Kontrolle darüber zu geben, wie Benutzerinteraktionen mit Agents überwacht und auf potenziell schädliche Inhalte gescannt werden. Content Moderation verhindert, dass hasserfüllte, sexuelle, gewalttätige, toxische, abwertende oder belästigungsbasierte Inhalte vom Agenten berücksichtigt oder generiert werden. Unser Leitplankenmodell klassifiziert Inhalte entlang der sechs Kategorien und kennzeichnet Inhalte, die zu einer dieser Kategorien gehören.

Sie können eine Aktion für die Benutzereingabeabfrage oder die Modellantwort ausführen:
  • Blockieren: Sie verhindern, dass der Agent die Benutzereingabe verarbeitet und eine Antwort generiert. Benutzer erhalten eine Fehlerantwort vom Agent.
  • Informieren: Sie gestatten dem Agent, die Benutzereingabe zu verarbeiten und eine Antwort zu generieren. Der Agent benachrichtigt den Benutzer, dass die Eingabe oder die Antwort Inhalt enthält, der Guardrail-Kriterien erfüllt.
  • Zulassen: Sie ermöglichen die Verarbeitung und/oder Generierung potenziell schädlicher Inhalte durch den Agent.

Die Aktion Blockieren wird für die Inhaltsmoderation ausgewählt, wenn Sie einen Agent erstellen. Oracle empfiehlt, Block als Guardrail-Auswahl für die Inhaltsmoderation beizubehalten.

Prompt-Injektion

Prompt Injection Guardrails für AI-Agenten sind ein Schutzmechanismus, der böswillige oder unbeabsichtigte Anweisungen erkennt, verhindert und mindert, die in Benutzereingaben eingebettet sind. Bei Prompt-Injection-Angriffen wird versucht, die ursprünglichen Anweisungen, Richtlinien oder Ziele des Agent zu überschreiben oder umzukehren, indem ausgeblendeter Text eingefügt wird, der das Modell anweist, vorherige Regeln zu ignorieren, Secrets zu exfiltrieren oder nicht autorisierte Aktionen auszuführen.

Sie können dieselben Aktionen auswählen, die Sie für die Inhaltsmoderation ausführen können: blockieren, informieren oder zulassen. Die Prompt Injection Guardrails gelten nur für die Benutzereingabeabfrage.
  • Blockieren: Sie verhindern, dass der Agent die Benutzereingabe verarbeitet. Benutzer erhalten eine Fehlerantwort vom Agent.
  • Informieren: Der Agent kann die Benutzereingabe verarbeiten. Der Agent benachrichtigt den Benutzer, dass die Eingabe Inhalte enthält, die Guardrail-Kriterien erfüllen.
  • Zulassen: Sie ermöglichen die Verarbeitung potenziell schädlicher Inhalte durch den Agent.

Die Aktion Blockieren wird beim Erstellen eines Agent als Prompt Injection ausgewählt. Oracle empfiehlt, Block als Guardrail-Auswahl für Prompt Injection beizubehalten.

Personenbezogene Daten (PII)

Die PII-Schutzschienen erkennen, blockieren oder maskieren PII automatisch aus den Benutzereingabeabfragen oder den Antworten der Agents. Diese Leitplanke verhindert, dass der Agent sensible Benutzerinformationen auf eine Weise offenlegt, die gegen Datenschutzbestimmungen oder Organisationsrichtlinien verstößt.

PII-Leitschienen unterstützen vier Entitätstypen:
  • Email
  • Telephone number
  • Physische Anschrift
  • Personenname
Für jede dieser vier Entitys wählen Sie aus, welche der folgenden Aktionen der Agent für die eingegebene Benutzerabfrage oder Agent-Antwort ausführt:
  • Blockieren: Sie verhindern, dass der Agent die Benutzereingabe verarbeitet und eine Antwort generiert. Benutzer erhalten eine Fehlerantwort vom Agent.
  • Informieren: Sie gestatten dem Agent, die Benutzereingabe zu verarbeiten und eine Antwort zu generieren. Der Agent benachrichtigt den Benutzer, dass die Eingabe oder die Antwort personenbezogene Daten enthielt.
  • Maske: Sie gestatten dem Agent, die Eingabe zu verarbeiten und eine maskierte Antwort zu generieren. Alle verwendeten personenbezogenen Daten werden verdeckt, um eine Exposition zu verhindern.
  • Zulassen: Sie erlauben die Verarbeitung und/oder Generierung von PII-Daten durch den Agent.

In einem neuen Agent sind personenbezogene Daten standardmäßig sowohl in der Benutzereingabe als auch in der Antwort zulässig. Oracle empfiehlt, den Guardrail für PII basierend auf Ihren Sicherheitsanforderungen sorgfältig auszuwählen.

Spezifische Guardrails in einem Knoten aktivieren

Sie können wählen, welche Leitplanken aktiviert werden sollen und wie sie konfiguriert werden sollen, wenn Sie Ihrer visuellen Leinwand einen Leitplankenknoten hinzufügen.

  1. Navigieren Sie zum Agent in Ihrem Workspace.
  2. Ziehen Sie einen Knoten Schutzschienen von der Palette auf die Leinwand.
  3. Geben Sie einen aussagekräftigen Namen und die Beschreibung für den Knoten an.

    Guardrails-Konfigurationsseite ist geöffnet. Name und Beschreibung werden hervorgehoben.

  4. Umschalten einer Leitplanke, um sie zu aktivieren und mit der Konfiguration zu beginnen. Wenn Sie den Umschalter erneut drücken, werden die Leitplanke und ihre Konfigurationen deaktiviert.

    Guardrails konfigurieren. Der Umschalter für die Inhaltsmoderation wird hervorgehoben.

  5. Wählen Sie die erforderliche Leitplankenkonfiguration für jede Kategorie aus.

    Die Guardrails-Konfigurationsseite wird angezeigt. Die Umschalter zur Prävention der Inhaltsmoderation und zur Erkennung der Prompt-Injection sind aktiviert und hervorgehoben. Eingabe- und Ausgabeoptionen sind auf "Block" gesetzt, und "Block" wird hervorgehoben.