22 護欄
Guardrails 是引導和控制 AI 代理行為的安全機制。
附註:
AI 資料平台工作台提供的導軌僅提供英文版。AI Data Platform Workbench 中提供的 Guardrails 由 OCI Generative AI 服務團隊實作。請參閱 OCI Generative AI 指南。AI Data Platform Workbench 服務會根據您的保全組態,在 OCI 租用戶中呼叫套用保全 API 。
視覺流程畫面中的界限
根據預設,除了模型提供者的原生安全控制之外,系統不會套用任何防護軌。若要新增監護人,您必須將監護人節點拖曳至您的代理程式視覺流程產生器,並將其連線至代理程式。
防護節點可篩選線上交談觸發程式與專員節點、主管與執行程式專員之間,或專員與工具節點之間的流量。在大多數情況下,我們建議在線上交談觸發器與專員節點之間使用單一防護節點。這會確保來自內送使用者的所有訊息和代理程式產生的訊息,都會透過保全項目進行篩選。

- 對談觸發節點與專員 (主管或執行者)
有哪些 Guardrails?
下圖顯示一般使用者與專員之間的簡單互動。在此情況下,會套用所有軌跡 (內容調解 – CM、提示注入預防 – PI 和 PII 偵測 – PII)。PI 僅適用於使用者查詢。
在一般使用者發出的第二則訊息之後,偵測到 PI 嘗試,且在代理程式開發人員對 PI 偵測 (封鎖) 選取動作之後封鎖使用者訊息。

內容管理
內容協調管制是大多數生成式 AI 中安全防護功能的通用實作。未勾選,LLM 可以產生有害的內容、促進暴力、種族歧視和性明確的內容。要讓專員開發人員完整檢視並控制如何監控與專員進行的使用者互動,以瞭解潛在有害的內容。內容協調管制,可防止代理程式考慮或產生仇恨、性、暴力、有毒、貶損或騷擾相關內容。我們的監護人模型會將這六個類別的內容分類,並標示屬於其中一個類別的內容。
- 區塊:您可以防止代理程式處理使用者輸入並產生回應。使用者會收到代理程式的錯誤回應。
- 通知:您可以允許代理程式處理使用者輸入並產生回應。代理程式會通知使用者輸入或回應包含符合監護條件的內容。
- 允許:您可以允許代理程式處理和 (或) 產生潛在有害的內容。
建立代理程式時,會選取封鎖動作以進行內容協調管制。Oracle 建議您保留區塊作為選擇內容的監護人。
提示插入
AI 代理的提示注入防護軌是一種保護機制,可偵測、防止和減輕使用者輸入中內嵌的惡意或非預期指示。提示插入攻擊會透過插入隱藏文字,告知模型忽略先前規則、篩選秘密或執行未經授權的動作,嘗試置換或反轉代理程式的原始指示、原則或目標。
- 區塊:您可以防止代理程式處理使用者輸入。使用者會收到代理程式的錯誤回應。
- 通知:您可以允許代理程式處理使用者輸入。代理程式會通知使用者輸入包含符合監護條件的內容。
- 允許:您可以允許代理程式處理潛在有害的內容。
當您建立代理程式時,會選取區塊動作來插入。Oracle 建議您保留區塊作為監護人選擇,以便立即插入。
個人身分資訊 (PII)
PII 防護軌會自動從使用者輸入查詢或代理程式回應中偵測、封鎖或遮罩 PII。此防護措施可防止代理程式以違反隱私權法規或組織原則的方式公開機密使用者資訊。
- 電子郵件
- Telephone number
- 實體位址
- 人員姓名
- 區塊:您可以防止代理程式處理使用者輸入並產生回應。使用者會收到代理程式的錯誤回應。
- 通知:您可以允許代理程式處理使用者輸入並產生回應。代理程式會通知使用者輸入或回應包含 PII。
- 遮罩:您可以允許代理程式處理輸入並產生遮罩回應。使用的任何 PII 都會被隱匿以防止暴露。
- 允許:您可以允許代理程式處理和 (或) 產生 PII 資料。
在新的代理程式中,預設允許使用者輸入和回應中使用 PII。Oracle 建議您根據安全需求,謹慎地選取 PII 的監護人。


