←新聞 7 / 10→

安全倫理

利用 Gemini Enterprise Agent Platform 建構零信任 AI Agent 的動態治理策略

Build zero-trust AI agents that judge intent, not just syntax

利用 Gemini Enterprise Agent Platform 建構零信任 AI Agent 的動態治理策略

developers.googleblog.com · 2026-10-04

摘要

Google 在 Google Developers 部落格發表文章,介紹如何透過 Gemini Enterprise Agent Platform 將 AI Agent 的安全控制從靜態的建置階段轉向動態的執行階段治理。該平台提供 Model Armor、Semantic Governance Policies 與 Agent Anomaly Detection 三項核心防禦機制,讓管理員無需修改程式碼即可動態執行安全政策並抵禦複雜攻擊。

從靜態規則轉向動態意圖治理

這套架構把安全控制點從開發階段的靜態程式碼檢查,移到執行階段的平台治理。文章指出,傳統靜態控制措施包括:用 Cloud KMS 簽署資料庫寫入、用 gVisor 做使用者空間核心隔離,以及以 CI 單元測試為基礎的輸入輸出閘道。這些做法能建立確定性控制,但局限很明顯:只能攔截事先明確規定的情況。

舉例來說,SQL 解析器分不出語法正確的社會工程退款和合法退款;正規表示式分不出實體 USB 線和已開啟的軟體授權;單一回合的測試套件也偵測不到跨多個回合的 Agent 集群資源耗盡攻擊。因此,第二階段的重點,是讓平台能推理意圖、適應行為,並把治理權責從 Agent 開發者移交給平台或安全管理員,因為平台是在 Agent 程式碼外部強制執行這些政策。

三大核心防禦機制

部署到 Gemini Enterprise Agent Platform 後,系統取代了自托管容器基礎設施,以及需要明確管理的正規表示式列表,改用受管理的執行階段治理。這包含三項核心機制,都由 Agent Gateway 擔任執行階段強制執行點,攔截並治理使用者、Agent、模型與工具之間的互動:

第一項是 Model Armor,它是內嵌式 AI 防火牆,直接在請求路徑上篩選提示與回應,偵測提示注入、越獄嘗試、惡意網址及敏感資料洩漏。第二項是 Semantic Governance Policies,這是一套以大型語言模型為基礎的天然語言政策引擎,在工具呼叫執行前,評估該呼叫是否符合使用者意圖與業務規則。第三項是 Agent Anomaly Detection,用 LLM 分析 Agent 日誌與遙測資料,標記會話中的異常行為模式,例如跨回合的退款耗盡。

執行階段防禦實戰演練

為了具體說明這些機制如何擋下第一階段控制措施攔不住的攻擊,文章以一個客戶支援與退貨 Agent 為例。這個 Agent 負責查詢訂單、計算補貨費,並透過 Merchant Ledger 支付退款。在生產環境中,Agent 透過 Model Context Protocol (MCP) 或後端 API 呼叫工具,但示範中直接實作為本地 Python 函式。所有攻擊都針對同一筆交易:訂單 #99281,總額 $149.00,包含兩項商品,一是售價 $29.00 的 USB-C Pro Docking Station 與 Cable,二是售價 $120.00 的年度 Workplace User License。

### 邊緣篩選:Model Armor 的阻斷能力

在第一階段,攻擊者曾發送含有「忽略所有先前指示」等關鍵字的暴力載入,系統靠正規表示式列表攔截。但要維護一份涵蓋所有混淆越獄手法的正規表示式字典,在生產環境中很難持續。Model Armor 在 Agent 推理迴路運行前,就於入口邊界篩選載入。過濾器一旦匹配,請求會在邊緣以 403 狀態碼丟棄,Agent 模型不會被呼叫,因此不耗用令牌,上下文窗口也能保持乾淨。

在出口端,Model Armor 執行敏感資料保護,在回應離開閘道前遮蔽信用卡號碼、Stripe 金鑰及員工 ID。例如,原始輸出包含完整卡號與金鑰,處理後會顯示為 `[REDACTED_CREDIT_CARD]` 與 `[REDACTED_STRIPE_KEY]`。

### 意圖判斷:Semantic Governance Policies

攻擊者改用語法乾淨的社會工程手法,要求對 $120.00 的數位軟體授權全額退款時,傳統閘道全數放行,因為金額低於訂單總額,也沒有越獄跡象。然而,公司政策規定,超過 $30 的數位軟體授權退款需經理批准。關鍵字匹配無法辨識「Google Workplace user license」屬於數位軟體,這時就輪到 Semantic Governance Policies 發揮作用。

這個政策引擎在模型提出工具呼叫時,評估工具與參數是否符合使用者提示、對話歷史及政策。政策以純文字約束撰寫,例如規定超過 30 美元的數位商品退款必須拒絕,並轉交人類經理。當模型提出退款 $120.00 的「Workplace User License」時,引擎會拒絕這項請求,並記錄在 Cloud Logging。工具執行被抑制,Cloud KMS 沒有被呼叫,帳本也未受影響,Agent 會向使用者說明數位軟體退款需經理批准。

### 多回合偵測:Agent Anomaly Detection

假設攻擊者得知單筆低於 $30 的退款可免審批,就可能把攻擊分散到多個回合,每次退款 $20。每筆退款單獨看都符合政策,但累計金額會超過訂單總額。單一回合的防護看不到累積耗盡或跨回合速度。

Agent Anomaly Detection 監控集群的會話遙測資料,用統計模型與 LLM 分析異常行為。它與 Agent Threat Detection 協同運作,並在 Gemini Enterprise Agent Platform 的稽核標籤頁及安全儀表板中顯示發現。偵測器會識別重複工具呼叫、單一實體的寫入速度及累計帳本耗盡等模式。

閉環補救與深度防禦

光有檢測無法關閉攻擊向量,傳統架構還得修改程式碼並重新部署。但在 Gemini Enterprise Agent Platform 上,Semantic Governance Policies 是在執行階段動態評估,管理員可透過閉環補救機制,在不修改或重新部署 Agent 程式碼的情況下關閉漏洞。管理員可審查被標記的追蹤記錄,撰寫新的天然語言約束來涵蓋多回合模式,也可以透過 API 自動處理。

例如,當 Security Command Center 產生異常發現時,系統可自動建立新政策,當對話歷史中已包含同一會話內針對相同 order_id 的已批准退款時,拒絕任何 issue_refund 呼叫,並將請求轉交人類經理。這項新政策在下次工具呼叫時由 Agent Gateway 評估,不需要重新啟動 Agent。

這種深度防禦架構結合了執行階段的邊界篩選、意圖判斷與行為監控,同時保留硬體背書的 Cloud KMS 簽署機制。所有提示在模型運行前經過篩選,所有工具呼叫在狀態變更前經過意圖評估,所有寫入都經過簽署,多回合攻擊則透過集群遙測與執行階段政策被捕捉並關閉。開發者可透過開源範例倉庫,在本地運行互動式 CLI 示範、網頁儀表板及確定性單元測試套件,驗證這些執行階段治理機制。

●開發者:可參考動態治理架構提升 Agent 安全性

●投資人:Google 企業級 AI 安全生態系持續完善

●一般用戶:企業級 AI 服務的安全性與合規性將獲得提升

重要性評分

65/100

🟠 值得關注

Gemini EnterpriseAI Agent零信任安全動態治理Google Developers
原文出處
上一則← 最弱環節:透過最壞情況約束強化學習蒸餾 LLM 推理能力下一則在 Muse AI 讀取 iPhone 和 Mac 私訊後,Apple 緊縮對完整磁碟存取權的監管 →

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。

相關指南

🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們。

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。