2m read

應用中的人工智慧安全:定義、威脅與控制

內容有哪些?

應用程式的 AI 安全是指保護使用 AI 的軟體免受攻擊、濫用、資料外洩及不安全行為的實務。內容涵蓋應用程式程式碼、模型行為、提示、訓練與檢索資料、推理 API、連接工具,以及任何能採取行動的 AI 代理。

什麼是應用中的 AI 安全?

AI 驅動的應用程式行為與傳統軟體不同。它們可以以機率方式回應,高度依賴資料品質,透過產生的輸出暴露敏感資訊,並可透過自然語言指令進行操作。當系統包含代理或工具使用時,模型回應也可能觸發其他系統的行動。

應用領域的人工智慧安全將傳統應用安全擴展至更廣泛的表面積。驗證、授權、安全編碼、日誌記錄、漏洞管理及相依性控制依然重要。他們已經不再單靠自己了。

人工智慧的安全與人工智慧安全

這個詞 人工智慧安全 有兩種用途,這也是定義有時會讓人覺得模糊的原因。

  • AI 安全:保護 AI 系統及 AI 驅動應用免受提示注入、資料中毒、模型盜用、不安全工具使用及未經授權存取 AI 資料或輸出等攻擊。
  • 人工智慧安全:利用人工智慧支援網路安全工作,如威脅偵測、警示分流、異常偵測、詐欺偵測或事件回應自動化。

兩種用法都是合理的。本文聚焦於人工智慧應用的安全。

為什麼重要

AI 應用現正被納入客戶支援、企業搜尋、軟體開發、分析、財務、醫療保健、人力資源、法律審查、資安營運及內部生產力工具。許多系統會接觸敏感資料或影響人們日後的決策。

風險不僅在於模型給出錯誤答案。一個易受攻擊的 AI 應用程式可能會洩露私人資料、取得使用者不該看到的紀錄、遵循隱藏在文件中的惡意指令、做出控的建議,或讓客服人員呼叫不該使用的工具。

威脅進入 AI 應用堆疊的來源

內容 常見的安全疑慮
資料層 訓練、微調、檢索及使用者提供資料。 資料中毒、敏感資料暴露、來源不明及未經核准的資料使用。
模型層 託管模型、自訂模型、權重、參數與模型配置。 模型竊取、反轉、竄改、漂移及對抗性操控。
提示與協調層 系統提示詞、提示範本、商業邏輯、檢索流程、路由與護欄。 提示注入、越獄、不安全的指令處理,以及邏輯繞過。
推論 API 層 端點用來呼叫模型並回傳輸出。 未經授權存取、濫用、模型擷取、速率限制繞過以及記錄薄弱。
代理與工具層 AI 代理、外掛、API、動作、工作流程觸發器以及委派任務。 過度自主、工具濫用、特權升級,以及不可逆的行為。
使用者介面層 顯示給使用者、員工、客戶或合作夥伴的體驗。 PII 外洩、過度揭露、誤導性輸出及不安全指引。

核心威脅類型

  • 快速注入:惡意指令會被放置在使用者提示詞、檢索文件、網頁、電子郵件或工具輸出中,使模型遵循攻擊者的指令,而非應用程式的預期政策。
  • 資料中毒:訓練、微調或檢索資料會被損壞,導致模型行為異常、嵌入後門,或產生偏頗或不安全的結果。
  • 型號盜用與倒置:攻擊者試圖複製模型行為、擷取模型資產,或從模型輸出推斷敏感的訓練資料。
  • 對抗性輸入:輸入被設計成讓模型誤分類、逃避偵測或行為異常。
  • 敏感資訊揭露:該應用程式透過提示、回應、日誌或檢索結果,揭露私人資料、機密、系統指令、訓練成果或使用者資訊。
  • 暗影人工智慧:員工或團隊在未經批准、可見性或審查的情況下使用 AI 工具。資料可能在組織尚未察覺 AI 工作流程存在前就離開受控環境。
  • 供應鏈風險:第三方模型、套件、資料集、外掛、模型登錄檔及 MLOps 管線可能會引入被入侵的元件或未經審查的行為。
  • 過度自主:AI 代理被賦予過多的自主權、過多的工具,或超出任務範圍的權限。這可能會把不良輸出變成有害的行為。

它與傳統應用程式安全有何不同

AI 應用安全是可加的。它並不取代 AppSec;它擴展了它。安全的 AI 應用仍需安全的 API、強認證、安全的會話處理、輸入驗證、相依性管理、秘密管理與監控。AI 會加入新的資產和新的故障模式。

尺寸 傳統應用程式安全 AI 應用安全
主要資產 程式碼、API、會話、使用者資料與基礎設施。 這些,加上模型、提示詞、資料管線、檢索系統和代理。
常見測試 SAST、DAST、相依性掃描、滲透測試及安全程式碼審查。 這些方法,加上 AI 紅隊、提示注入測試、模型評估與對抗性測試。
失效模式 錯誤、漏洞利用、存取控制缺口或資料外洩。 問題一樣,加上模型行為控、輸出不安全,以及未經授權的工具動作。
治理需求 安全軟體開發、合規、存取控制、變更管理及事件回應。 這些,加上模型來源、AI 政策、資料使用規則和執行時可觀察性。

AI 應用安全的關鍵控制

  • 要對完整的 AI 工作流程進行威脅建模,而不僅僅是網頁端點。
  • 將受信任的系統指令與不受信任的使用者、文件、網頁或工具內容分開。
  • 限制提示與工具呼叫,使模型無法將任意文字轉化為任意動作。
  • 對模型、資料來源、檢索儲存庫、API、外掛及代理程式實施最低權限存取。
  • 在敏感資料進入提示或出現在輸出中之前,先過濾、分類並遮蔽。
  • 在下游系統將其視為事實、程式碼、指令或可執行指令之前,先驗證模型輸出。
  • 追蹤模型來源、已簽署的產物、核准的資料集,以及提示詞或編排邏輯的變更。
  • 監控生產行為,注意漂移、異常提示、異常工具使用、洩漏模式及政策違規。
  • 對於高風險行動,特別是財務、法律、刪除、外部通訊或特權操作,請使用人工批准。
  • 建立一套 AI 安全政策,規範核准的工具、供應商、資料使用、客服人員權限、測試、監控及事件回應。

保護 AI 代理

特工值得特別待遇,因為他們能規劃和行動。聊天機器人可能會回答得很差;客服人員可能會將答案傳送給客戶、更新 CRM 紀錄、刪除檔案、開啟拉取請求,或觸發工作流程。

較安全的起始態態是零信任。不要因為內部人員屬於組織就認為安全。給它一個狹窄的角色、短暫的權限、明確的工具界限、完整記錄,以及對重要動作設置核准檢查點。

架構與參考點

AI 應用安全並沒有統一的通用基準。實務工作者通常結合多種參考資料:OWASP 針對大型語言模型與 AI 安全風險的指引、NIST AI RMF 用於 AI 風險管理、NIST 生成式 AI SSDF 規範用於安全開發實務、ISO/IEC 42001 用於 AI 管理系統,以及威脅知情資源如 MITRE ATLAS。

這些來源間的有效模式是一致的:管理整個生命週期的 AI 風險,將資料與模型完整性視為安全考量,直接測試 AI 行為,文件所有權,並在發布後監控部署系統。

常見問題

人工智慧安全在應用領域最簡單的定義是什麼?

它是保護使用人工智慧的軟體,包括模型、資料、提示、API、檢索系統及代理,免受攻擊或濫用的實務。

它和傳統的AppSec有什麼不同?

傳統應用安全保護程式碼、API、身份、基礎設施與資料。AI 應用安全同時保護模型行為、訓練與檢索資料、提示邏輯、產生輸出及代理行動。

哪些框架是相關的?

OWASP 的大型語言模型與人工智慧安全指引、NIST AI RMF、NIST SP 800-218A、ISO/IEC 42001 以及 MITRE ATLAS 都是有用的參考資料。大多數組織仍需將其轉化為實際的內部基準。

結論

應用的 AI 安全最好被理解為對學習、生成、檢索及行動系統的應用安全擴展。工作從熟悉的 AppSec 基礎開始,接著延伸至模型行為、資料完整性、提示控制、代理權限及執行時可觀察性。隨著 AI 成為真實產品與工作流程的一部分,可靠的方法會分層:保護應用程式、保護模型、保護資料,並保護 AI 允許執行的每一個行動。

This page was machine-translated. If you notice any inaccuracies or have feedback, please feel free to send it to us here.