22 Guardrails de proteção

Guardrails são mecanismos de segurança para orientar e controlar o comportamento dos agentes de IA.

No Oracle AI Data Platform Workbench, as grades de proteção são configuradas para evitar a geração ou o consumo de conteúdo tóxico e malicioso por agentes. Guardrails também impedem o vazamento de informações de identificação pessoal (PII) pelo agente. Os guardrails específicos disponíveis no Workbench da Plataforma de Dados de IA se aplicam à moderação de conteúdo, injeção de prompt e PII.

Observação:

Os corrimãos oferecidos pelo Workbench da Plataforma de Dados de IA só estão disponíveis em inglês.

Os Guardrails oferecidos no Workbench da Plataforma de Dados de IA são implementados pela equipe de serviço da OCI Generative AI. Consulte Guardrails for OCI Generative AI. Com base na configuração dos seus guardrails, o serviço Workbench da AI Data Platform chama a API Aplicar Guardrails na tenancy do OCI.

Guardrails em Visual Flow Canvas

Por padrão, nenhum corrimão é aplicado ao seu sistema além dos controles de segurança nativos do provedor do modelo. Para adicionar guardrails, você deve arrastar um nó de guardrails para o criador de fluxo visual do agente e conectá-lo ao agente.

Um nó de guardrails pode filtrar o tráfego entre um acionador de chat e um nó de agente, entre um supervisor e agentes executores ou entre nós de agente e ferramenta. Para a maioria dos cenários, recomendamos um único nó de guardrails entre o trigger de chat e o nó do agente. Isso garantirá que todas as mensagens do usuário de entrada e as mensagens geradas pelo agente serão filtradas pelos guardrails.


Um agente aberto ao criador visual. O nó de guardrails é destacado na paleta.

O nó de guardrails só pode ser inserido entre:
  • Um nó de trigger de chat e um agente (supervisor ou executor)

Quais Guardrails estão disponíveis?

O diagrama abaixo mostra uma interação simples entre um usuário final e um agente. Neste cenário, todos os guadrails são aplicados (moderação de conteúdo – CM, prevenção de injeção imediata – PI e detecção de PII – PII). O PI só é aplicado à consulta do usuário.

Após a segunda mensagem emitida pelo usuário final, uma tentativa de PI foi detectada e a mensagem do usuário foi bloqueada após a ação selecionada do desenvolvedor do agente na detecção de PI (bloco).


Diagrama descrevendo um exemplo de corrimãos do agente de IA

Moderação do Conteúdo

A moderação de conteúdo é uma implementação comum de guardrails na maioria das IA generativa. Sem controle, os LLMs podem gerar conteúdo prejudicial, promover conteúdo violento, racista e sexualmente explícito. É imperativo dar aos desenvolvedores do agente total visibilidade e controle sobre como as interações do usuário com os agentes são monitoradas e verificadas em busca de conteúdo potencialmente prejudicial. A moderação de conteúdo impede que conteúdos odiosos, sexuais, violentos, tóxicos, depreciativos ou baseados em assédio sejam considerados ou gerados pelo agente. Nosso modelo de guardrails classifica o conteúdo ao longo dessas seis categorias e sinaliza o conteúdo que pertence a uma dessas categorias.

Você pode optar por executar uma ação na consulta de entrada do usuário ou na resposta do modelo:
  • Bloqueio: Você impede que o agente processe a entrada do usuário e gere uma resposta. Os usuários recebem uma resposta de erro do agente.
  • Informar: Você permite que o agente processe a entrada do usuário e gere uma resposta. O agente notifica o usuário de que a entrada ou a resposta continha conteúdo que atendia aos critérios de guardrail.
  • Permitir: Você permite o processamento e/ou a geração de conteúdo potencialmente prejudicial pelo agente.

A ação Bloquear é selecionada para moderação de conteúdo quando você cria um agente. A Oracle recomenda manter o Bloqueio como sua seleção de guardrail para moderação de conteúdo.

Injeção de Prompt

Os guardrails de injeção imediata para agentes de IA são um mecanismo de proteção que detecta, evita e mitiga instruções maliciosas ou não intencionais incorporadas nas entradas do usuário. Os ataques de injeção de prompt tentam substituir ou subverter as instruções, políticas ou metas originais do agente inserindo texto oculto que diz ao modelo para ignorar regras anteriores, exfiltrar segredos ou executar ações não autorizadas.

Você pode escolher as mesmas ações que podem ser tomadas para a moderação de conteúdo: bloquear, informar ou permitir. Os guardrails de injeção de prompt só se aplicam à consulta de entrada do usuário.
  • Bloco: Você impede que o agente processe a entrada do usuário. Os usuários recebem uma resposta de erro do agente.
  • Informar: Você permite que o agente processe a entrada do usuário. O agente notifica o usuário de que a entrada continha conteúdo que atendia aos critérios de guardrail.
  • Permitir: Você permite o processamento de conteúdo potencialmente prejudicial pelo agente.

A ação Bloquear é selecionada quando você cria um agente. A Oracle recomenda manter o Bloco como sua seleção de corrimão para injeção imediata.

Informações de Identificação Individual (PII)

Os guardrails de PII detectam, bloqueiam ou mascaram automaticamente PII das consultas de entrada do usuário ou das respostas dos agentes. Esse guardrail impede que o agente exponha informações confidenciais do usuário de maneiras que violem regulamentos de privacidade ou políticas organizacionais.

As grades de proteção PII suportam quatro tipos de entidade:
  • E-mail
  • Número de telefone
  • Endereço físico
  • Nome da pessoa
Para cada uma dessas quatro entidades, você opta por aplicar quais das seguintes ações seu agente executa na consulta de usuário de entrada ou na resposta do agente:
  • Bloco: Você impede que o agente processe a entrada do usuário e gere uma resposta. Os usuários recebem uma resposta de erro do agente.
  • Informar: Você permite que o agente processe a entrada do usuário e gere uma resposta. O agente notifica o usuário de que a entrada ou a resposta continha PII.
  • Mascaramento: Você permite que o agente processe a entrada e gere uma resposta mascarada. Qualquer PII usado é redigido para evitar a exposição.
  • Permitir: Você permite o processamento e/ou a geração de dados de PII pelo agente.

Em um novo agente, o PII é permitido na entrada e na resposta do usuário por padrão. A Oracle recomenda que você selecione cuidadosamente o guardrail para PII com base em suas necessidades de segurança.

Ativar Guardrails Específicos em um Nó

Você pode escolher quais guardrails ativar e como cada um é configurado ao adicionar um nó de guardrail à sua tela visual.

  1. Navegue até o agente em seu espaço de trabalho.
  2. Arraste um nó Guardrails da paleta para a tela.
  3. Forneça um nome e descrição significativos para o nó.

    A página de configuração Guardrails está aberta. O nome e descrição são realçados.

  4. Alterne um corrimão para ativá-lo e comece a configurar. Pressionar o botão de alternância novamente desativa o corrimão e suas configurações.

    Configuração dos corrimões. A alternância para prevenção de moderação de conteúdo é destacada.

  5. Selecione a configuração de corrimão necessária para cada categoria.

    A página de configuração de corrimões é exibida. As alternâncias para prevenção de moderação de conteúdo e detecção de injeção de prompt estão habilitadas e realçadas. As opções de Entrada e Saída são definidas para bloquear e o Bloco é destacado.