什麼是智能體人工智慧安全?
智能體人工智慧安全是指保護能夠在有限的人工監督下進行規劃、使用工具、存取資料和採取行動的人工智慧系統。關鍵在於執行。聊天機器人可能會給出錯誤答案;而客服人員可以更新工單、呼叫 API、更改配置、查詢資料庫、發送訊息或觸發工作流程。
這就改變了安全問題。僅僅詢問模型是否能被欺騙而產生不安全的文字已經不夠了。團隊還需要了解代理商被允許做什麼、使用什麼身分、可以使用哪些工具、可以存取哪些資料、何時需要手動批准操作,以及是否可以在以後重建完整的操作鏈。
智能體人工智慧安全定義
智能體人工智慧是指能夠透過多個步驟實現目標的人工智慧系統。系統可以將工作分解成子任務,讀取外部內容,使用內存,調用工具,與其他代理協調,並決定下一步要做什麼,而無需人批准每一個步驟。
智能體人工智慧安全機制保護了這種運作模式。它包括用於驗證代理、限制權限、驗證工具呼叫、將可信任指令與不可信內容分開、保護記憶體和上下文、監控運行時行為以及在不安全操作成為真實系統的實際更改之前阻止它們等控制措施。
智能體人工智慧與智能體人工智慧安全
這兩個詞很容易混淆,但它們描述的是不同的事物。智能體人工智慧是一種能力。智能體人工智慧安全是圍繞該能力的控制系統。
智能體人工智慧安全與LLM安全有何不同?
LLM 和生成式AI 的安全性仍然至關重要。當系統具有代理能力時,快速注入、越獄、敏感資料外洩、不安全輸出、模型濫用和供應鏈風險並不會消失。由於該模型現在與工具、憑證和業務流程相連,因此它們變得更加重要。
差別在於爆炸半徑。在基本的聊天體驗中,攻擊者可能會得到誤導性的答案或在回覆中洩漏訊息。在代理工作流程中,同樣的操作可以變成工具呼叫、檔案變更、帳戶更新、外部電子郵件,或是跨多個系統的一系列操作。
智能體人工智慧攻擊面
思考智能體人工智慧安全性的一個有效方法是追蹤從指令到行動的路徑。該模型只是這條道路的一部分。
指令和模型層:此模型解讀目標並決定下一步。直接提示、間接提示注入、惡意檢索的內容以及不安全的工具輸出都可能影響該決定。
記憶體和上下文層:代理通常會保留任務記錄、使用者偏好、檢索到的事實、嵌入或摘要。如果這一層被污染,代理人可能會將錯誤的假設帶入未來的工作中。
工具和API層:每次工具呼叫都會建立一個邊界,在這個邊界內,輸入、輸出、權限、速率限制和業務規則都需要遵守。功能強大的工具、連接器或 MCP 伺服器,如果驗證機制薄弱,可能會將糟糕的計劃變成真正的事故。
身分和權限層:代理人需要具備相應的資格才能開展工作。如果這些憑證範圍廣、有效期長,或是繼承自人類用戶,那麼該代理人就可以成為進入組織的高價值途徑。
編排層:這是圍繞著該模型的規劃、路由、委派和工作流程邏輯。在多智能體系統中,編排層也負責管理智能體之間的切換和信任。
運行時和環境層:代理程式在此處對文件、應用程式、雲端資源、程式碼、訊息、資料庫和生產系統進行操作。此處的控制措施決定了錯誤或洩漏事件的傳播範圍。
主要威脅類別
即時注射和目標劫持
當某種藥物能夠發揮作用時,立即註射會變得更加危險。隱藏在網頁、文件、支援工單、電子郵件或工具回應中的惡意指令可以引導代理偏離使用者的目標。實際問題不僅在於答案會改變。也就是說,代理可能會呼叫錯誤的工具、洩漏數據,或執行使用者從未打算執行的任務。
過度授權和過度許可
當一個智能體能夠完成的任務超出其所需時,它就具有過度自主性。這可能意味著工具過多、憑證範圍過廣、沒有審批門、速率限製過弱,或者工作完成後存取權限仍然有效。最安全的特工並非擁有最多工具的特工。正是權限最窄的那個人,才讓它完成了這項工作。
工具誤用和混亂的代理人風險
代理通常充當使用者和工具之間的中介。如果代理的權限比使用者高,攻擊者可以嘗試誘騙代理執行攻擊者無法直接執行的操作。這是一個典型的由人工智慧工作流程表達的混亂代理人問題。
記憶和情境中毒
持久化記憶很有用,因為它能讓代理人保持連續性。這樣做也有風險,因為損壞的記憶體可能會影響以後的會話。記憶體條目需要來源、保留規則、審查路徑以及隔離或刪除不良上下文的方法。
供應鍊和插件妥協
代理系統依賴框架、插件、工具、檢索來源、提示、連接器、MCP 伺服器和模型端點。篡改的工具、偽造的軟體包、被污染的知識庫或被破壞的連接器可以將惡意指令或不安全的資料輸入到代理程式的工作流程中。
多智能體級聯
多智能體系統會增加協調風險。一個代理人可能會將錯誤的假設傳遞給另一個代理;一個受損的工具輸出可能會成為後續多個行動的起點。代理人之間相互委託的越多,設計明確的信任邊界就越重要,而不是假設每個內部代理人都是安全的。
審計性和問責差距
如果一個團隊無法重現代理人所看到、決定、呼叫、更改和升級的內容,那麼它就無法管理該系統。代理日誌需要記錄操作鏈,而不僅僅是最終結果。這對於受監管的工作流程和高影響力決策尤其重要。
智能體人工智慧安全的核心控制
- 將代理視為具有所有者、範圍、生命週期狀態和撤銷路徑的一等身分。
- 在代理層級和工具層級都應用最小權限原則。權限應該與任務相匹配,而不是與代理未來可能需要的最大能力相匹配。
- 在執行操作時授權操作。允許代理程式啟動任務這一事實不應自動授權對下游所有工具的呼叫。
- 在執行操作之前,請使用工具允許清單、嚴格的輸入驗證、輸出驗證、速率限制和業務規則檢查。
- 將可信指令與不可信內容分開。檢索到的文件、電子郵件、頁面和工具輸出不應在不發出任何聲音的情況下重寫代理的操作指令。
- 在受限環境中(例如沙箱、測試模式或隔離工作區)執行高風險操作。
- 透過來源標籤、完整性檢查、保留規則以及用於審查或回滾的工作流程來保護記憶體。
- 以防篡改的方式記錄提示、檢索到的上下文、工具呼叫、參數、批准、拒絕、交接和結果。
- 對於影響重大、不可逆轉、面向外部、涉及財務、享有特權或與安全相關的行動,需要人為批准。
- 使用對抗性提示、惡意工具輸出、權限邊界測試、記憶體中毒場景和多代理交接失敗來測試代理程式。
威脅控制映射
重要的架構和參考資料
目前還沒有一個標準能夠完全定義智能體人工智慧的安全性。這個類別仍在形成中,因此團隊通常需要將AI 風險管理、應用程式安全、身分安全和新興的代理特定指導結合起來。
如何決定合適的自主程度
並非每項行動都需要同等程度的控制。正確的問題是:如果這種做法是錯的,會發生什麼事?影響較小、可逆的操作通常可以透過自動化檢查來執行。影響重大或不可逆轉的行動應獲得批准、更嚴格的日誌記錄和更嚴格的權限控制。
一個實用的自主性模型會考慮四個因素:影響力、可逆性、資料敏感度和特權等級。在測試工單佇列中重設草稿狀態與停用生產帳戶、轉帳、變更防火牆策略或透過電子郵件傳送客戶資料是不同的。智能體人工智慧安全是一門認真對待這些差異的學科。
智能體人工智慧作為安全工具
智能體人工智慧不僅僅是安全團隊需要防禦的對象。它還可以支援安全運作。代理可以對警報進行分類、總結事件證據、關聯日誌、起草回應步驟、建立工單或自動執行低風險的遏制任務。
但這並不意味著它們可以免受管制。防禦代理可能擁有對敏感遙測資料、終端操作、身分識別系統或雲端資源的存取權限。智能體的作用越大,限制和監控它的行為就越重要。
結論
智能體人工智慧安全問題之所以存在,是因為人工智慧系統正在從提供建議轉向採取行動。一旦模型能夠使用工具、保存記憶體、呼叫 API 並協調跨系統的工作,安全性就必須更接近執行層面。持久有效的方法是結構性的:賦予代理不同的身份,限制權限,驗證工具,保護內存,記錄每一個有意義的步驟,並在操作過於敏感而無法盲目自動化時要求人工批准。在智能體系統中,信任不是模型一次就能獲得的。每次代理人嘗試採取行動時,都必須進行檢查。
This page was machine-translated. If you notice any inaccuracies or have feedback, please feel free to send it to us here.