22 Guardrails de proteção
Guardrails são mecanismos de segurança para orientar e controlar o comportamento dos agentes de IA.
Observação:
Os corrimãos oferecidos pelo Workbench da Plataforma de Dados de IA só estão disponíveis em inglês.Os Guardrails oferecidos no Workbench da Plataforma de Dados de IA são implementados pela equipe de serviço da OCI Generative AI. Consulte Guardrails for OCI Generative AI. Com base na configuração dos seus guardrails, o serviço Workbench da AI Data Platform chama a API Aplicar Guardrails na tenancy do OCI.
Guardrails em Visual Flow Canvas
Por padrão, nenhum corrimão é aplicado ao seu sistema além dos controles de segurança nativos do provedor do modelo. Para adicionar guardrails, você deve arrastar um nó de guardrails para o criador de fluxo visual do agente e conectá-lo ao agente.
Um nó de guardrails pode filtrar o tráfego entre um acionador de chat e um nó de agente, entre um supervisor e agentes executores ou entre nós de agente e ferramenta. Para a maioria dos cenários, recomendamos um único nó de guardrails entre o trigger de chat e o nó do agente. Isso garantirá que todas as mensagens do usuário de entrada e as mensagens geradas pelo agente serão filtradas pelos guardrails.

- Um nó de trigger de chat e um agente (supervisor ou executor)
Quais Guardrails estão disponíveis?
O diagrama abaixo mostra uma interação simples entre um usuário final e um agente. Neste cenário, todos os guadrails são aplicados (moderação de conteúdo – CM, prevenção de injeção imediata – PI e detecção de PII – PII). O PI só é aplicado à consulta do usuário.
Após a segunda mensagem emitida pelo usuário final, uma tentativa de PI foi detectada e a mensagem do usuário foi bloqueada após a ação selecionada do desenvolvedor do agente na detecção de PI (bloco).

Moderação do Conteúdo
A moderação de conteúdo é uma implementação comum de guardrails na maioria das IA generativa. Sem controle, os LLMs podem gerar conteúdo prejudicial, promover conteúdo violento, racista e sexualmente explícito. É imperativo dar aos desenvolvedores do agente total visibilidade e controle sobre como as interações do usuário com os agentes são monitoradas e verificadas em busca de conteúdo potencialmente prejudicial. A moderação de conteúdo impede que conteúdos odiosos, sexuais, violentos, tóxicos, depreciativos ou baseados em assédio sejam considerados ou gerados pelo agente. Nosso modelo de guardrails classifica o conteúdo ao longo dessas seis categorias e sinaliza o conteúdo que pertence a uma dessas categorias.
- Bloqueio: Você impede que o agente processe a entrada do usuário e gere uma resposta. Os usuários recebem uma resposta de erro do agente.
- Informar: Você permite que o agente processe a entrada do usuário e gere uma resposta. O agente notifica o usuário de que a entrada ou a resposta continha conteúdo que atendia aos critérios de guardrail.
- Permitir: Você permite o processamento e/ou a geração de conteúdo potencialmente prejudicial pelo agente.
A ação Bloquear é selecionada para moderação de conteúdo quando você cria um agente. A Oracle recomenda manter o Bloqueio como sua seleção de guardrail para moderação de conteúdo.
Injeção de Prompt
Os guardrails de injeção imediata para agentes de IA são um mecanismo de proteção que detecta, evita e mitiga instruções maliciosas ou não intencionais incorporadas nas entradas do usuário. Os ataques de injeção de prompt tentam substituir ou subverter as instruções, políticas ou metas originais do agente inserindo texto oculto que diz ao modelo para ignorar regras anteriores, exfiltrar segredos ou executar ações não autorizadas.
- Bloco: Você impede que o agente processe a entrada do usuário. Os usuários recebem uma resposta de erro do agente.
- Informar: Você permite que o agente processe a entrada do usuário. O agente notifica o usuário de que a entrada continha conteúdo que atendia aos critérios de guardrail.
- Permitir: Você permite o processamento de conteúdo potencialmente prejudicial pelo agente.
A ação Bloquear é selecionada quando você cria um agente. A Oracle recomenda manter o Bloco como sua seleção de corrimão para injeção imediata.
Informações de Identificação Individual (PII)
Os guardrails de PII detectam, bloqueiam ou mascaram automaticamente PII das consultas de entrada do usuário ou das respostas dos agentes. Esse guardrail impede que o agente exponha informações confidenciais do usuário de maneiras que violem regulamentos de privacidade ou políticas organizacionais.
- Número de telefone
- Endereço físico
- Nome da pessoa
- Bloco: Você impede que o agente processe a entrada do usuário e gere uma resposta. Os usuários recebem uma resposta de erro do agente.
- Informar: Você permite que o agente processe a entrada do usuário e gere uma resposta. O agente notifica o usuário de que a entrada ou a resposta continha PII.
- Mascaramento: Você permite que o agente processe a entrada e gere uma resposta mascarada. Qualquer PII usado é redigido para evitar a exposição.
- Permitir: Você permite o processamento e/ou a geração de dados de PII pelo agente.
Em um novo agente, o PII é permitido na entrada e na resposta do usuário por padrão. A Oracle recomenda que você selecione cuidadosamente o guardrail para PII com base em suas necessidades de segurança.


