應用中的人工智慧安全:定義、威脅與控制
應用程式的 AI 安全是指保護使用 AI 的軟體免受攻擊、濫用、資料外洩及不安全行為的實務。內容涵蓋應用程式程式碼、模型行為、提示、訓練與檢索資料、推理 API、連接工具,以及任何能採取行動的 AI 代理。
什麼是應用中的 AI 安全?
AI 驅動的應用程式行為與傳統軟體不同。它們可以以機率方式回應,高度依賴資料品質,透過產生的輸出暴露敏感資訊,並可透過自然語言指令進行操作。當系統包含代理或工具使用時,模型回應也可能觸發其他系統的行動。
應用領域的人工智慧安全將傳統應用安全擴展至更廣泛的表面積。驗證、授權、安全編碼、日誌記錄、漏洞管理及相依性控制依然重要。他們已經不再單靠自己了。
人工智慧的安全與人工智慧安全
這個詞 人工智慧安全 有兩種用途,這也是定義有時會讓人覺得模糊的原因。
- AI 安全:保護 AI 系統及 AI 驅動應用免受提示注入、資料中毒、模型盜用、不安全工具使用及未經授權存取 AI 資料或輸出等攻擊。
- 人工智慧安全:利用人工智慧支援網路安全工作,如威脅偵測、警示分流、異常偵測、詐欺偵測或事件回應自動化。
兩種用法都是合理的。本文聚焦於人工智慧應用的安全。
為什麼重要
AI 應用現正被納入客戶支援、企業搜尋、軟體開發、分析、財務、醫療保健、人力資源、法律審查、資安營運及內部生產力工具。許多系統會接觸敏感資料或影響人們日後的決策。
風險不僅在於模型給出錯誤答案。一個易受攻擊的 AI 應用程式可能會洩露私人資料、取得使用者不該看到的紀錄、遵循隱藏在文件中的惡意指令、做出控的建議,或讓客服人員呼叫不該使用的工具。
威脅進入 AI 應用堆疊的來源
核心威脅類型
- 快速注入:惡意指令會被放置在使用者提示詞、檢索文件、網頁、電子郵件或工具輸出中,使模型遵循攻擊者的指令,而非應用程式的預期政策。
- 資料中毒:訓練、微調或檢索資料會被損壞,導致模型行為異常、嵌入後門,或產生偏頗或不安全的結果。
- 型號盜用與倒置:攻擊者試圖複製模型行為、擷取模型資產,或從模型輸出推斷敏感的訓練資料。
- 對抗性輸入:輸入被設計成讓模型誤分類、逃避偵測或行為異常。
- 敏感資訊揭露:該應用程式透過提示、回應、日誌或檢索結果,揭露私人資料、機密、系統指令、訓練成果或使用者資訊。
- 暗影人工智慧:員工或團隊在未經批准、可見性或審查的情況下使用 AI 工具。資料可能在組織尚未察覺 AI 工作流程存在前就離開受控環境。
- 供應鏈風險:第三方模型、套件、資料集、外掛、模型登錄檔及 MLOps 管線可能會引入被入侵的元件或未經審查的行為。
- 過度自主:AI 代理被賦予過多的自主權、過多的工具,或超出任務範圍的權限。這可能會把不良輸出變成有害的行為。
它與傳統應用程式安全有何不同
AI 應用安全是可加的。它並不取代 AppSec;它擴展了它。安全的 AI 應用仍需安全的 API、強認證、安全的會話處理、輸入驗證、相依性管理、秘密管理與監控。AI 會加入新的資產和新的故障模式。
AI 應用安全的關鍵控制
- 要對完整的 AI 工作流程進行威脅建模,而不僅僅是網頁端點。
- 將受信任的系統指令與不受信任的使用者、文件、網頁或工具內容分開。
- 限制提示與工具呼叫,使模型無法將任意文字轉化為任意動作。
- 對模型、資料來源、檢索儲存庫、API、外掛及代理程式實施最低權限存取。
- 在敏感資料進入提示或出現在輸出中之前,先過濾、分類並遮蔽。
- 在下游系統將其視為事實、程式碼、指令或可執行指令之前,先驗證模型輸出。
- 追蹤模型來源、已簽署的產物、核准的資料集,以及提示詞或編排邏輯的變更。
- 監控生產行為,注意漂移、異常提示、異常工具使用、洩漏模式及政策違規。
- 對於高風險行動,特別是財務、法律、刪除、外部通訊或特權操作,請使用人工批准。
- 建立一套 AI 安全政策,規範核准的工具、供應商、資料使用、客服人員權限、測試、監控及事件回應。
保護 AI 代理
特工值得特別待遇,因為他們能規劃和行動。聊天機器人可能會回答得很差;客服人員可能會將答案傳送給客戶、更新 CRM 紀錄、刪除檔案、開啟拉取請求,或觸發工作流程。
較安全的起始態態是零信任。不要因為內部人員屬於組織就認為安全。給它一個狹窄的角色、短暫的權限、明確的工具界限、完整記錄,以及對重要動作設置核准檢查點。
架構與參考點
AI 應用安全並沒有統一的通用基準。實務工作者通常結合多種參考資料:OWASP 針對大型語言模型與 AI 安全風險的指引、NIST AI RMF 用於 AI 風險管理、NIST 生成式 AI SSDF 規範用於安全開發實務、ISO/IEC 42001 用於 AI 管理系統,以及威脅知情資源如 MITRE ATLAS。
這些來源間的有效模式是一致的:管理整個生命週期的 AI 風險,將資料與模型完整性視為安全考量,直接測試 AI 行為,文件所有權,並在發布後監控部署系統。
常見問題
人工智慧安全在應用領域最簡單的定義是什麼?
它是保護使用人工智慧的軟體,包括模型、資料、提示、API、檢索系統及代理,免受攻擊或濫用的實務。
它和傳統的AppSec有什麼不同?
傳統應用安全保護程式碼、API、身份、基礎設施與資料。AI 應用安全同時保護模型行為、訓練與檢索資料、提示邏輯、產生輸出及代理行動。
哪些框架是相關的?
OWASP 的大型語言模型與人工智慧安全指引、NIST AI RMF、NIST SP 800-218A、ISO/IEC 42001 以及 MITRE ATLAS 都是有用的參考資料。大多數組織仍需將其轉化為實際的內部基準。
結論
應用的 AI 安全最好被理解為對學習、生成、檢索及行動系統的應用安全擴展。工作從熟悉的 AppSec 基礎開始,接著延伸至模型行為、資料完整性、提示控制、代理權限及執行時可觀察性。隨著 AI 成為真實產品與工作流程的一部分,可靠的方法會分層:保護應用程式、保護模型、保護資料,並保護 AI 允許執行的每一個行動。
This page was machine-translated. If you notice any inaccuracies or have feedback, please feel free to send it to us here.