22 가드레일

가드레일은 AI 에이전트의 동작을 안내하고 제어하기 위한 안전 메커니즘입니다.

Oracle AI Data Platform Workbench에서 가드레일은 에이전트가 유독하고 악의적인 콘텐츠를 생성하거나 사용하지 못하도록 구성됩니다. Guardrails는 또한 에이전트에 의한 개인 식별 정보 (PII)의 누출을 방지합니다. AI 데이터 플랫폼 워크벤치에서 사용할 수 있는 특정 보호 한계선은 콘텐츠 조정, 프롬프트 삽입 및 PII에 적용됩니다.

주:

AI 데이터 플랫폼 워크벤치에서 제공하는 가드레일은 영어로만 제공됩니다.

AI 데이터 플랫폼 워크벤치에서 제공되는 가드레일은 OCI 생성형 AI 서비스 팀이 구현합니다. OCI Generative AI용 가이드레일을 참고하세요. AI 데이터 플랫폼 워크벤치 서비스는 가드레일 구성에 따라 OCI 테넌시 내에서 가드레일 API 적용을 호출합니다.

비주얼 플로우 캔버스의 난간

기본적으로 모델 공급자의 기본 안전 제어를 넘어서는 보호대는 시스템에 적용되지 않습니다. 난간을 추가하려면 난간 노드를 에이전트 시각적 흐름 빌더로 끌어서 에이전트에 연결해야 합니다.

보호자 노드는 채팅 트리거와 에이전트 노드 간, 감독자와 실행자 에이전트 간 또는 에이전트와 도구 노드 간 트래픽을 필터링할 수 있습니다. 대부분의 시나리오에서는 채팅 트리거와 에이전트 노드 사이에 단일 보호 한계선 노드를 사용하는 것이 좋습니다. 이렇게 하면 에이전트가 생성한 수신 사용자 및 메시지의 메시지가 보호대를 통해 필터링됩니다.


시각적 빌더에 열려 있는 에이전트입니다. 가드레일 노드가 팔레트에서 강조 표시됩니다.

난간 노드는 다음 사이에만 삽입할 수 있습니다.
  • 채팅 트리거 노드 및 에이전트(감독자 또는 실행자)

어떤 가드레일을 사용할 수 있습니까?

아래 다이어그램은 일반 사용자와 에이전트 간의 간단한 상호 작용을 보여줍니다. 이 시나리오에서는 모든 가드레일이 적용됩니다(콘텐츠 조정 - CM, 프롬프트 주입 방지 - PI 및 PII 감지 - PII). PI는 사용자 질의에만 적용됩니다.

최종 사용자가 발행한 두 번째 메시지 이후 PI 시도가 감지되었고 PI 감지(블록)에서 에이전트 개발자가 선택한 조치에 따라 사용자 메시지가 차단되었습니다.


AI 에이전트 가드레일 예를 설명하는 다이어그램

콘텐츠 조정

콘텐츠 조정은 대부분의 생성형 AI에서 가드레일을 일반적으로 구현하는 작업입니다. 선택하지 않은 LLM은 유해한 콘텐츠를 생성하고, 폭력적이고, 인종차별적이며, 성적으로 명시적인 콘텐츠를 홍보할 수 있습니다. 에이전트 개발자에게 에이전트와의 사용자 상호 작용이 모니터링되고 스캔되는 방식에 대한 완전한 가시성과 제어력을 제공하여 잠재적으로 유해한 콘텐츠를 파악하는 것이 중요합니다. 콘텐츠 조정은 증오, 성적, 폭력적, 독성, 특례적 또는 괴롭힘 기반 콘텐츠가 에이전트에 의해 고려되거나 생성되는 것을 방지합니다. 당사의 가드레일 모델은 이러한 6가지 범주 및 해당 범주 중 하나에 속하는 플래그 콘텐츠에 따라 콘텐츠를 분류합니다.

사용자 입력 질의 또는 모델 응답에 대해 작업을 수행하도록 선택할 수 있습니다.
  • 블록: 에이전트가 사용자 입력을 처리하고 응답을 생성하지 못하도록 합니다. 사용자가 에이전트로부터 오류 응답을 받습니다.
  • 정보: 에이전트가 사용자 입력을 처리하고 응답을 생성할 수 있도록 허용합니다. 에이전트는 가드레일 기준을 충족하는 콘텐츠가 포함된 입력 또는 응답 중 하나임을 사용자에게 통지합니다.
  • 허용: 에이전트가 잠재적으로 유해한 콘텐츠의 처리 및/또는 생성을 허용합니다.

에이전트를 생성할 때 콘텐츠 조정에 대해 블록 작업이 선택됩니다. Oracle은 블록을 콘텐츠 조정에 대한 보호 한계선 선택으로 유지할 것을 권장합니다.

프롬프트 주입

AI 에이전트에 대한 프롬프트 사출 가드레일은 사용자 입력에 포함된 악의적이거나 의도하지 않은 지침을 감지, 방지 및 완화하는 보호 메커니즘입니다. 프롬프트 삽입 공격은 모델에 이전 규칙을 무시하거나, 암호를 추출하거나, 권한이 부여되지 않은 작업을 실행하도록 지시하는 숨겨진 텍스트를 삽입하여 에이전트의 원래 지침, 정책 또는 목표를 대체하거나 훼손하려고 시도합니다.

콘텐츠 조정에 대해 수행할 수 있는 동일한 작업(블록, 정보 또는 허용)을 선택할 수 있습니다. 프롬프트 주입 가드레일은 유저 입력 query에만 적용됩니다.
  • 블록: 에이전트가 사용자 입력을 처리하지 못하도록 합니다. 사용자가 에이전트로부터 오류 응답을 받습니다.
  • 정보: 에이전트가 사용자 입력을 처리할 수 있도록 허용합니다. 에이전트는 가드레일 기준을 충족하는 콘텐츠가 입력에 포함되어 있음을 사용자에게 통지합니다.
  • 허용: 에이전트가 잠재적으로 유해한 콘텐츠의 처리를 허용합니다.

블록 작업은 에이전트를 생성할 때 프롬프트 삽입을 선택합니다. Oracle은 블록을 프롬프트 삽입을 위한 보호 한계선 선택으로 유지할 것을 권장합니다.

개인 식별 정보(PII)

PII 보호 장치는 사용자 입력 쿼리 또는 에이전트 응답에서 PII를 자동으로 감지, 차단 또는 마스킹합니다. 이 보호 장치는 에이전트가 개인 정보 보호 규정이나 조직 정책을 위반하는 방식으로 민감한 사용자 정보를 노출하지 못하도록 방지합니다.

PII 보호 레일은 다음 네 가지 엔티티 유형을 지원합니다.
  • 전자메일
  • Telephone number
  • 물리적 주소
  • 개인 이름
이러한 네 개의 엔티티 각각에 대해 에이전트가 입력 사용자 질의 또는 에이전트 응답에 대해 수행할 다음 작업 중 하나를 적용하도록 선택합니다.
  • 블록: 에이전트가 사용자 입력을 처리하고 응답을 생성하지 못하도록 합니다. 사용자가 에이전트로부터 오류 응답을 받습니다.
  • 정보: 에이전트가 사용자 입력을 처리하고 응답을 생성할 수 있도록 허용합니다. 에이전트는 입력 또는 응답에 PII가 포함되어 있음을 사용자에게 알립니다.
  • 마스크: 에이전트가 입력을 처리하고 마스킹된 응답을 생성할 수 있도록 허용합니다. 사용되는 모든 PII는 노출을 방지하기 위해 개정됩니다.
  • 허용: 에이전트가 PII 데이터를 처리 및/또는 생성할 수 있습니다.

새 에이전트에서는 기본적으로 사용자 입력과 응답 모두에서 PII가 허용됩니다. Oracle은 보안 요구사항에 따라 PII에 대한 보호 한계선을 신중하게 선택할 것을 권장합니다.

노드에서 특정 보호 한계선 사용

시각적 캔버스에 난간 노드를 추가할 때 사용으로 설정할 난간과 각각의 구성 방법을 선택할 수 있습니다.

  1. 작업 영역의 에이전트로 이동합니다.
  2. 팔레트에서 캔버스로 가드레일 노드를 끌어옵니다.
  3. 노드에 대해 의미 있는 이름과 설명을 제공합니다.

    Guardrails 구성 페이지가 열려 있습니다. 이름 및 설명이 강조 표시됩니다.

  4. 가드레일을 토글하여 사용으로 설정하고 구성을 시작합니다. 토글을 다시 누르면 난간 및 해당 구성이 사용 안함으로 설정됩니다.

    Guardrails 구성입니다. 컨텐트 조정 방지 토글이 강조 표시됩니다.

  5. 각 범주에 대해 필요한 난간 구성을 선택합니다.

    Guardrails 구성 페이지가 표시됩니다. 콘텐츠 조정 방지 및 프롬프트 주입 감지에 대한 토글이 사용으로 설정되고 강조 표시됩니다. 입력 및 출력 옵션이 블록으로 설정되고 블록이 강조 표시됩니다.