22 Schutzschienen
Leitschienen sind Sicherheitsmechanismen, mit denen das Verhalten von KI-Agenten gesteuert und gesteuert wird.
Hinweis:
Die von der AI Data Platform Workbench angebotenen Guardrails sind nur in englischer Sprache verfügbar.Die in der AI Data Platform Workbench angebotenen Guardrails werden vom OCI Generative AI-Serviceteam implementiert. Siehe Guardrails für OCI Generative AI. Basierend auf Ihrer Guardrails-Konfiguration ruft der AI Data Platform Workbench-Service die Apply Guardrails-API in Ihrem OCI-Mandanten auf.
Geländer in Visual Flow Canvas
Standardmäßig werden keine Leitschienen über die nativen Sicherheitskontrollen des Modellanbieters hinaus auf Ihr System angewendet. Um Leitschienen hinzuzufügen, müssen Sie einen Leitschienenknoten an den visuellen Ablaufgenerator Ihres Agent ziehen und mit dem Agent verbinden.
Ein Guardrails-Knoten kann den Datenverkehr zwischen einem Chat-Trigger und einem Agent-Knoten, zwischen einem Supervisor und Executor-Agents oder zwischen Agent- und Toolknoten filtern. In den meisten Szenarios wird ein einzelner Guardrails-Knoten zwischen dem Chattrigger und dem Agent-Knoten empfohlen. Dadurch wird sichergestellt, dass alle Nachrichten des eingehenden Benutzers und Nachrichten, die vom Agent generiert werden, über die Leitplanken gefiltert werden.

- Ein Chattriggerknoten und ein Agent (Supervisor oder Executor)
Welche Leitplanken sind verfügbar?
Das folgende Diagramm zeigt eine einfache Interaktion zwischen einem Endbenutzer und einem Agent. In diesem Szenario werden alle Guadrails angewendet (Inhaltsmoderation – CM, prompte Injektionsprävention – PI und PII-Erkennung – PII). PI wird nur auf die Benutzerabfrage angewendet.
Nach der zweiten vom Endbenutzer ausgegebenen Nachricht wurde ein PI-Versuch erkannt, und die Benutzernachricht wurde nach der ausgewählten Aktion des Agent-Entwicklers bei der PI-Erkennung (Block) blockiert.

Inhaltsmoderation
Content Moderation ist eine gängige Implementierung von Leitplanken in den meisten generativen KI. Ungeprüft können LLMs schädliche Inhalte generieren, gewalttätige, rassistische und sexuell explizite Inhalte fördern. Es ist unerlässlich, Agent-Entwicklern vollständige Transparenz und Kontrolle darüber zu geben, wie Benutzerinteraktionen mit Agents überwacht und auf potenziell schädliche Inhalte gescannt werden. Content Moderation verhindert, dass hasserfüllte, sexuelle, gewalttätige, toxische, abwertende oder belästigungsbasierte Inhalte vom Agenten berücksichtigt oder generiert werden. Unser Leitplankenmodell klassifiziert Inhalte entlang der sechs Kategorien und kennzeichnet Inhalte, die zu einer dieser Kategorien gehören.
- Blockieren: Sie verhindern, dass der Agent die Benutzereingabe verarbeitet und eine Antwort generiert. Benutzer erhalten eine Fehlerantwort vom Agent.
- Informieren: Sie gestatten dem Agent, die Benutzereingabe zu verarbeiten und eine Antwort zu generieren. Der Agent benachrichtigt den Benutzer, dass die Eingabe oder die Antwort Inhalt enthält, der Guardrail-Kriterien erfüllt.
- Zulassen: Sie ermöglichen die Verarbeitung und/oder Generierung potenziell schädlicher Inhalte durch den Agent.
Die Aktion Blockieren wird für die Inhaltsmoderation ausgewählt, wenn Sie einen Agent erstellen. Oracle empfiehlt, Block als Guardrail-Auswahl für die Inhaltsmoderation beizubehalten.
Prompt-Injektion
Prompt Injection Guardrails für AI-Agenten sind ein Schutzmechanismus, der böswillige oder unbeabsichtigte Anweisungen erkennt, verhindert und mindert, die in Benutzereingaben eingebettet sind. Bei Prompt-Injection-Angriffen wird versucht, die ursprünglichen Anweisungen, Richtlinien oder Ziele des Agent zu überschreiben oder umzukehren, indem ausgeblendeter Text eingefügt wird, der das Modell anweist, vorherige Regeln zu ignorieren, Secrets zu exfiltrieren oder nicht autorisierte Aktionen auszuführen.
- Blockieren: Sie verhindern, dass der Agent die Benutzereingabe verarbeitet. Benutzer erhalten eine Fehlerantwort vom Agent.
- Informieren: Der Agent kann die Benutzereingabe verarbeiten. Der Agent benachrichtigt den Benutzer, dass die Eingabe Inhalte enthält, die Guardrail-Kriterien erfüllen.
- Zulassen: Sie ermöglichen die Verarbeitung potenziell schädlicher Inhalte durch den Agent.
Die Aktion Blockieren wird beim Erstellen eines Agent als Prompt Injection ausgewählt. Oracle empfiehlt, Block als Guardrail-Auswahl für Prompt Injection beizubehalten.
Personenbezogene Daten (PII)
Die PII-Schutzschienen erkennen, blockieren oder maskieren PII automatisch aus den Benutzereingabeabfragen oder den Antworten der Agents. Diese Leitplanke verhindert, dass der Agent sensible Benutzerinformationen auf eine Weise offenlegt, die gegen Datenschutzbestimmungen oder Organisationsrichtlinien verstößt.
- Telephone number
- Physische Anschrift
- Personenname
- Blockieren: Sie verhindern, dass der Agent die Benutzereingabe verarbeitet und eine Antwort generiert. Benutzer erhalten eine Fehlerantwort vom Agent.
- Informieren: Sie gestatten dem Agent, die Benutzereingabe zu verarbeiten und eine Antwort zu generieren. Der Agent benachrichtigt den Benutzer, dass die Eingabe oder die Antwort personenbezogene Daten enthielt.
- Maske: Sie gestatten dem Agent, die Eingabe zu verarbeiten und eine maskierte Antwort zu generieren. Alle verwendeten personenbezogenen Daten werden verdeckt, um eine Exposition zu verhindern.
- Zulassen: Sie erlauben die Verarbeitung und/oder Generierung von PII-Daten durch den Agent.
In einem neuen Agent sind personenbezogene Daten standardmäßig sowohl in der Benutzereingabe als auch in der Antwort zulässig. Oracle empfiehlt, den Guardrail für PII basierend auf Ihren Sicherheitsanforderungen sorgfältig auszuwählen.


