22 Guardrails

Les garde-corps sont des mécanismes de sécurité pour guider et contrôler le comportement des agents d'IA.

Dans Oracle AI Data Platform Workbench, les garde-corps sont configurés pour empêcher la génération ou la consommation de contenu toxique et malveillant par les agents. Les garde-corps empêchent également la fuite d'informations personnellement identifiables (PII) par l'agent. Les garde-fous spécifiques disponibles dans votre workbench AI Data Platform s'appliquent à la modération de contenu, à l'injection d'invite et aux informations d'identification personnelle.

Remarques :

Les garde-corps proposés par AI Data Platform Workbench ne sont disponibles qu'en anglais.

Les garde-corps proposés dans AI Data Platform Workbench sont implémentés par l'équipe de service OCI Generative AI. Reportez-vous à Guardrails pour OCI Generative AI. En fonction de votre configuration de garde-corps, le service Workbench AI Data Platform appelle l'API Apply Guardrails dans votre location OCI.

Guardrails dans Visual Flow Canvas

Par défaut, aucun garde-corps n'est appliqué à votre système au-delà des contrôles de sécurité natifs du fournisseur de modèle. Pour ajouter des garde-corps, vous devez faire glisser un noeud de garde-corps vers le générateur de flux visuel de l'agent et le connecter à l'agent.

Un noeud de garde-corps peut filtrer le trafic entre un déclencheur de discussion et un noeud d'agent, entre un superviseur et des agents exécutifs, ou entre des noeuds d'agent et d'outil. Pour la plupart des scénarios, nous recommandons un seul noeud de garde-fous entre le déclencheur de discussion et le noeud d'agent. Cela garantit que tous les messages de l'utilisateur entrant et les messages générés par l'agent seront filtrés par les garde-corps.


Agent ouvert au constructeur visuel. Le noeud de garde-corps est mis en surbrillance dans la palette.

Le noeud de garde-corps ne peut être inséré qu'entre :
  • Un noeud de déclencheur de discussion et un agent (superviseur ou exécuteur)

Quels sont les garde-corps disponibles ?

Le diagramme ci-dessous illustre une interaction simple entre un utilisateur final et un agent. Dans ce scénario, tous les guadrails sont appliqués (modération de contenu – CM, prévention des injections rapides – PI, et détection des PII – PII). PI n'est appliqué qu'à la requête utilisateur.

Après le second message émis par l'utilisateur final, une tentative PI a été détectée et le message utilisateur a été bloqué suite à l'action sélectionnée par le développeur de l'agent sur la détection PI (bloc).


Diagramme décrivant un exemple de garde-corps d'agent AI

Modération du contenu

La modération de contenu est une implémentation courante des garde-fous dans la plupart des IA génératives. Non coché, les LLM peuvent générer du contenu nuisible, promouvoir du contenu violent, raciste et sexuellement explicite. Il est impératif de donner aux développeurs d'agents une visibilité et un contrôle complets sur la façon dont les interactions des utilisateurs avec les agents sont surveillées et analysées à la recherche de contenu potentiellement dangereux. La modération du contenu empêche le contenu haineux, sexuel, violent, toxique, péjoratif ou fondé sur le harcèlement d'être considéré ou généré par l'agent. Notre modèle de garde-corps classe le contenu selon ces six catégories et signale le contenu qui appartient à l'une de ces catégories.

Vous pouvez choisir d'effectuer une action sur la requête d'entrée utilisateur ou la réponse de modèle :
  • Bloquer : vous empêchez l'agent de traiter l'entrée utilisateur et de générer une réponse. Les utilisateurs reçoivent une réponse d'erreur de l'agent.
  • Informatique : vous autorisez l'agent à traiter l'entrée utilisateur et à générer une réponse. L'agent informe l'utilisateur que l'entrée ou la réponse contenait un contenu répondant aux critères de garde-corps.
  • Autoriser : vous autorisez le traitement et/ou la génération de contenu potentiellement dangereux par l'agent.

L'action Bloquer est sélectionnée pour la modération de contenu lorsque vous créez un agent. Oracle recommande de conserver Bloquer comme sélection de garde-corps pour la modération de contenu.

Injection d'invite

Les garde-fous d'injection rapide pour les agents d'IA sont un mécanisme de protection qui détecte, prévient et atténue les instructions malveillantes ou involontaires intégrées dans les entrées utilisateur. Les attaques par injection d'invite tentent de remplacer ou de modifier les instructions, stratégies ou objectifs d'origine de l'agent en insérant un texte masqué indiquant au modèle d'ignorer les règles précédentes, d'éliminer les secrets ou d'exécuter des actions non autorisées.

Vous pouvez choisir les mêmes actions que pour la modération de contenu : bloquer, informer ou autoriser. Les garde-fous d'injection d'invite s'appliquent uniquement à la requête d'entrée utilisateur.
  • Bloquer : vous empêchez l'agent de traiter l'entrée utilisateur. Les utilisateurs reçoivent une réponse d'erreur de l'agent.
  • Informatique : vous autorisez l'agent à traiter l'entrée utilisateur. L'agent informe l'utilisateur que l'entrée contenait un contenu répondant aux critères de garde-corps.
  • Autoriser : vous autorisez le traitement de contenu potentiellement dangereux par l'agent.

L'action Bloquer est sélectionnée lorsque vous créez un agent. Oracle recommande de conserver Block comme sélection de garde-corps pour l'injection rapide.

Informations d'identification personnelles (PII)

Les garde-corps PII détectent, bloquent ou masquent automatiquement les informations d'identification personnelle des requêtes d'entrée utilisateur ou des réponses des agents. Ce garde-corps empêche l'agent d'exposer les informations sensibles des utilisateurs d'une manière qui viole les réglementations de confidentialité ou les politiques organisationnelles.

Les garde-corps PII prennent en charge quatre types d'entité :
  • Courriel
  • Numéro de téléphone
  • Adresse physique
  • Nom du patient
Pour chacune de ces quatre entités, vous choisissez d'appliquer l'une des actions suivantes que votre agent effectue sur la requête utilisateur d'entrée ou la réponse de l'agent :
  • Bloquer : vous empêchez l'agent de traiter l'entrée utilisateur et de générer une réponse. Les utilisateurs reçoivent une réponse d'erreur de l'agent.
  • Informatique : vous autorisez l'agent à traiter l'entrée utilisateur et à générer une réponse. L'agent informe l'utilisateur que l'entrée ou la réponse contenait des informations d'identification personnelle.
  • Masque : vous autorisez l'agent à traiter l'entrée et à générer une réponse masquée. Toutes les informations d'identification personnelle utilisées sont occultées pour éviter toute exposition.
  • Autoriser : vous autorisez le traitement et/ou la génération de données d'identification personnelle par l'agent.

Dans un nouvel agent, les informations d'identification personnelle sont autorisées à la fois dans la saisie utilisateur et dans la réponse par défaut. Oracle vous recommande de sélectionner soigneusement la garde-corps pour les informations d'identification personnelle en fonction de vos besoins en matière de sécurité.

Activer des garde-corps spécifiques dans un noeud

Vous pouvez choisir les garde-corps à activer et la façon dont chacun est configuré lors de l'ajout d'un noeud de garde-corps à votre canevas visuel.

  1. Accédez à l'agent dans votre espace de travail.
  2. Faites glisser un noeud Guardrails de votre palette vers votre canevas.
  3. Fournissez une description et un nom explicites pour le noeud.

    La page de configuration Guardrails est ouverte. La description et le nom sont mis en surbrillance.

  4. Activez une glissière de sécurité pour l'activer et commencez à la configurer. Le fait d'appuyer à nouveau sur la bascule désactive la garde-corps et ses configurations.

    Configuration des garde-corps. La bascule Prévention de la modération de contenu est mise en évidence.

  5. Sélectionnez la configuration de garde-corps nécessaire pour chaque catégorie.

    La page de configuration Guardrails s'affiche. Les options de prévention de la modération de contenu et de détection des injections rapides sont activées et mises en surbrillance. Les options d'entrée et de sortie sont définies sur Block et Block est mis en surbrillance.