22 Pistas
Las barandillas son mecanismos de seguridad para guiar y controlar el comportamiento de los agentes de IA.
Note:
Las barandillas que ofrece el área de trabajo de AI Data Platform solo están disponibles en inglés.Las barandillas que se ofrecen en el área de trabajo de AI Data Platform son implementadas por el equipo de servicio de OCI Generative AI. Consulte Guardrails for OCI Generative AI. En función de la configuración de las guías de protección, el servicio de área de trabajo de AI Data Platform llama a la API de aplicación de guías de protección en su arrendamiento de OCI.
Barandillas en lienzo de flujo visual
Por defecto, no se aplican barandillas al sistema más allá de los controles de seguridad nativos del proveedor del modelo. Para agregar barandillas, debe arrastrar un nodo de barandillas al creador de flujos visuales del agente y conectarlo al agente.
Un nodo de guías de protección puede filtrar el tráfico entre un disparador de chat y un nodo de agente, entre un supervisor y un agente ejecutor, o entre nodos de agente y herramienta. Para la mayoría de los escenarios, recomendamos un único nodo de guías de protección entre el disparador de chat y el nodo de agente. Esto garantizará que los mensajes del usuario entrante y los mensajes generados por el agente se filtren mediante las guías.

- Un nodo disparador de chat y un agente (supervisor o ejecutor)
¿Qué barandillas están disponibles?
En el diagrama siguiente se muestra una interacción sencilla entre un usuario final y un agente. En este escenario, se aplican todas las guías (moderación de contenido – CM, prevención de inyección inmediata – PI y detección de PII – PII). PI solo se aplica a la consulta del usuario.
Después del segundo mensaje emitido por el usuario final, se detectó un intento de PI y el mensaje de usuario se bloqueó después de la acción seleccionada por el desarrollador del agente en la detección de PI (bloque).

Moderación del Contenido
La moderación de contenido es una implementación común de barandillas en la mayoría de la IA generativa. Sin marcar, los LLM pueden generar contenido dañino, promover contenido violento, racista y sexualmente explícito. Es imprescindible proporcionar a los desarrolladores de agentes visibilidad y control completos sobre cómo se supervisan y exploran las interacciones de los usuarios con los agentes en busca de contenido potencialmente dañino. La moderación del contenido impide que el contenido de odio, sexual, violento, tóxico, despectivo o basado en el acoso sea considerado o generado por el agente. Nuestro modelo de barandillas clasifica el contenido a lo largo de esas seis categorías y marca el contenido que pertenece a una de esas categorías.
- Bloquear: evita que el agente procese la entrada del usuario y genere una respuesta. Los usuarios reciben una respuesta de error del agente.
- Informar: permite al agente procesar la entrada de usuario y generar una respuesta. El agente notifica al usuario que la entrada o la respuesta contienen contenido que cumple los criterios de la guía.
- Permitir: permite que el agente procese y/o genere contenido potencialmente dañino.
La acción Bloquear se selecciona para la moderación de contenido al crear un agente. Oracle recomienda mantener Block como selección de guía para la moderación de contenido.
Petición de datos de inyección
Las barandillas de inyección rápidas para agentes de IA son un mecanismo de protección que detecta, previene y mitiga las instrucciones maliciosas o no deseadas incrustadas en las entradas del usuario. Los ataques de inyección de petición de datos intentan anular o subvertir las instrucciones, políticas o objetivos originales del agente insertando texto oculto que indica al modelo que ignore las reglas anteriores, filtre secretos o ejecute acciones no autorizadas.
- Bloquear: impide que el agente procese la entrada del usuario. Los usuarios reciben una respuesta de error del agente.
- Informe: permite al agente procesar la entrada de usuario. El agente notifica al usuario que la entrada contiene contenido que cumple los criterios de la guía.
- Permitir: permite que el agente procese contenido potencialmente dañino.
La acción Block (Bloquear) se selecciona cuando se crea un agente. Oracle recomienda mantener Block como su selección de guía para la inyección de petición de datos.
Información de identificación individual (PII)
Las guías de protección de PII detectan, bloquean o enmascaran automáticamente la PII de las consultas de entrada del usuario o de las respuestas de los agentes. Esta barrera evita que el agente exponga información confidencial del usuario de formas que violen las regulaciones de privacidad o las políticas organizativas.
- Correo electrónico
- Número de teléfono
- Dirección Física
- Nombre persona
- Bloquear: impide que el agente procese la entrada del usuario y genere una respuesta. Los usuarios reciben una respuesta de error del agente.
- Informar: permite al agente procesar la entrada de usuario y generar una respuesta. El agente notifica al usuario que la entrada o la respuesta contienen información de identificación personal.
- Máscara: permite al agente procesar la entrada y generar una respuesta enmascarada. Cualquier información de identificación personal utilizada se elimina para evitar la exposición.
- Permitir: permite que el agente procese y/o genere datos de PII.
En un nuevo agente, la PII se permite tanto en la entrada de usuario como en la respuesta por defecto. Oracle recomienda seleccionar cuidadosamente la guía para la PII en función de sus necesidades de seguridad.


