22 Pistas

Las barandillas son mecanismos de seguridad para guiar y controlar el comportamiento de los agentes de IA.

En el área de trabajo de Oracle AI Data Platform, las barandillas se configuran para evitar que los agentes generen o consuman contenido tóxico y malicioso. Las barandillas también previenen la fuga de información de identificación personal (PII) por parte del agente. Las guías específicas disponibles en el área de trabajo de AI Data Platform se aplican a la moderación del contenido, la inyección de mensajes y la PII.

Note:

Las barandillas que ofrece el área de trabajo de AI Data Platform solo están disponibles en inglés.

Las barandillas que se ofrecen en el área de trabajo de AI Data Platform son implementadas por el equipo de servicio de OCI Generative AI. Consulte Guardrails for OCI Generative AI. En función de la configuración de las guías de protección, el servicio de área de trabajo de AI Data Platform llama a la API de aplicación de guías de protección en su arrendamiento de OCI.

Barandillas en lienzo de flujo visual

Por defecto, no se aplican barandillas al sistema más allá de los controles de seguridad nativos del proveedor del modelo. Para agregar barandillas, debe arrastrar un nodo de barandillas al creador de flujos visuales del agente y conectarlo al agente.

Un nodo de guías de protección puede filtrar el tráfico entre un disparador de chat y un nodo de agente, entre un supervisor y un agente ejecutor, o entre nodos de agente y herramienta. Para la mayoría de los escenarios, recomendamos un único nodo de guías de protección entre el disparador de chat y el nodo de agente. Esto garantizará que los mensajes del usuario entrante y los mensajes generados por el agente se filtren mediante las guías.


Un agente abierto al creador visual. El nodo de guías de protección se resalta en la paleta.

El nodo de guías de protección solo se puede insertar entre:
  • Un nodo disparador de chat y un agente (supervisor o ejecutor)

¿Qué barandillas están disponibles?

En el diagrama siguiente se muestra una interacción sencilla entre un usuario final y un agente. En este escenario, se aplican todas las guías (moderación de contenido – CM, prevención de inyección inmediata – PI y detección de PII – PII). PI solo se aplica a la consulta del usuario.

Después del segundo mensaje emitido por el usuario final, se detectó un intento de PI y el mensaje de usuario se bloqueó después de la acción seleccionada por el desarrollador del agente en la detección de PI (bloque).


Diagrama que describe un ejemplo de guías de agente de AI

Moderación del Contenido

La moderación de contenido es una implementación común de barandillas en la mayoría de la IA generativa. Sin marcar, los LLM pueden generar contenido dañino, promover contenido violento, racista y sexualmente explícito. Es imprescindible proporcionar a los desarrolladores de agentes visibilidad y control completos sobre cómo se supervisan y exploran las interacciones de los usuarios con los agentes en busca de contenido potencialmente dañino. La moderación del contenido impide que el contenido de odio, sexual, violento, tóxico, despectivo o basado en el acoso sea considerado o generado por el agente. Nuestro modelo de barandillas clasifica el contenido a lo largo de esas seis categorías y marca el contenido que pertenece a una de esas categorías.

Puede realizar una acción en la consulta de entrada de usuario o en la respuesta del modelo:
  • Bloquear: evita que el agente procese la entrada del usuario y genere una respuesta. Los usuarios reciben una respuesta de error del agente.
  • Informar: permite al agente procesar la entrada de usuario y generar una respuesta. El agente notifica al usuario que la entrada o la respuesta contienen contenido que cumple los criterios de la guía.
  • Permitir: permite que el agente procese y/o genere contenido potencialmente dañino.

La acción Bloquear se selecciona para la moderación de contenido al crear un agente. Oracle recomienda mantener Block como selección de guía para la moderación de contenido.

Petición de datos de inyección

Las barandillas de inyección rápidas para agentes de IA son un mecanismo de protección que detecta, previene y mitiga las instrucciones maliciosas o no deseadas incrustadas en las entradas del usuario. Los ataques de inyección de petición de datos intentan anular o subvertir las instrucciones, políticas o objetivos originales del agente insertando texto oculto que indica al modelo que ignore las reglas anteriores, filtre secretos o ejecute acciones no autorizadas.

Puede elegir las mismas acciones que se pueden realizar para la moderación del contenido: bloquear, informar o permitir. Las guías de inyección de petición de datos solo se aplican a la consulta de entrada de usuario.
  • Bloquear: impide que el agente procese la entrada del usuario. Los usuarios reciben una respuesta de error del agente.
  • Informe: permite al agente procesar la entrada de usuario. El agente notifica al usuario que la entrada contiene contenido que cumple los criterios de la guía.
  • Permitir: permite que el agente procese contenido potencialmente dañino.

La acción Block (Bloquear) se selecciona cuando se crea un agente. Oracle recomienda mantener Block como su selección de guía para la inyección de petición de datos.

Información de identificación individual (PII)

Las guías de protección de PII detectan, bloquean o enmascaran automáticamente la PII de las consultas de entrada del usuario o de las respuestas de los agentes. Esta barrera evita que el agente exponga información confidencial del usuario de formas que violen las regulaciones de privacidad o las políticas organizativas.

Las guías de protección de PII soportan cuatro tipos de entidad:
  • Correo electrónico
  • Número de teléfono
  • Dirección Física
  • Nombre persona
Para cada una de esas cuatro entidades, decide aplicar cuál de las siguientes acciones realiza su agente en la consulta de usuario de entrada o en la respuesta del agente:
  • Bloquear: impide que el agente procese la entrada del usuario y genere una respuesta. Los usuarios reciben una respuesta de error del agente.
  • Informar: permite al agente procesar la entrada de usuario y generar una respuesta. El agente notifica al usuario que la entrada o la respuesta contienen información de identificación personal.
  • Máscara: permite al agente procesar la entrada y generar una respuesta enmascarada. Cualquier información de identificación personal utilizada se elimina para evitar la exposición.
  • Permitir: permite que el agente procese y/o genere datos de PII.

En un nuevo agente, la PII se permite tanto en la entrada de usuario como en la respuesta por defecto. Oracle recomienda seleccionar cuidadosamente la guía para la PII en función de sus necesidades de seguridad.

Activación de guías de protección específicas en un nodo

Puede elegir qué barandillas activar y cómo se configura cada una al agregar un nodo de barandilla al lienzo visual.

  1. Vaya al agente en el espacio de trabajo.
  2. Arrastre un nodo Guardrails de la paleta al lienzo.
  3. Proporcione un nombre y descripción significativos para el nodo.

    La página de configuración de las guías está abierta. Se resaltan el nombre y la descripción.

  4. Conmute una guía para activarla y comenzar a configurarla. Al pulsar de nuevo el conmutador, se desactiva la guía y sus configuraciones.

    Configuración de guías. Se resalta el conmutador para la prevención de moderación de contenido.

  5. Seleccione la configuración de barandilla necesaria para cada categoría.

    Se muestra la página de configuración de guías. Los alternadores para la prevención de moderación de contenido y la detección de inyección de mensaje están habilitados y resaltados. Las opciones de entrada y salida se definen en bloque y Block se resalta.