什麼是人工智慧安全風險?
人工智慧安全風險是指人工智慧系統可能受到攻擊、操縱、外洩或濫用,導致其資料、模型、工具或輸出停止如預期運作的方式。這個術語涵蓋兩個方向的威脅:針對人工智慧系統的攻擊和利用人工智慧來加強攻擊者自身的行動。
這種區別很重要。被污染的訓練集、被盜的模型和快速注入攻擊都會對人工智慧系統本身構成風險。深度偽造詐騙電話或人工智慧產生的網路釣魚活動有所不同:人工智慧被用作濫用的工具。兩者都屬於人工智慧安全範疇,但需要不同的控制措施。
人工智慧安全風險包括哪些方面?
AI 安全風險主要集中在對抗性活動、濫用以及對 AI 資產(如訓練資料、模型權重、提示、推理 API、嵌入、工具、日誌和生成的輸出)的保護。它們比一般的AI風險範圍更窄,後者還包括公平性、工作流失、環境影響和長期社會問題等。
簡單來說,網路安全領域的核心在於:傳統網路安全保護軟體、網路、身分和資料。AI 安全將這項工作擴展到統計的、資料驅動的系統,這些系統的行為可以透過訓練資料、提示、模型介面、連接工具和下游自動化來影響。
人工智慧安全風險對比相關術語
關於人工智慧風險的詞彙仍在不斷完善,因此相鄰術語經常變得模糊不清。下表列出了最常見的概念。
簡而言之:對抗性機器學習是人工智慧安全的技術子集;人工智慧安全風險是通用人工智慧風險的一個更狹窄的子集;人工智慧安全與安全有所重疊,但也涵蓋了非對抗性危害。
人工智慧為何會帶來新的安全風險?
人工智慧改變了安全形勢,因為模型的行為與普通的確定性軟體不同。它們的輸出取決於資料、上下文、機率和學習到的模式。這會導致一些標準應用程式和基礎設施控制措施無法完全覆蓋的故障模式。
- 機率行為。同一個系統可能會根據提示語、上下文、檢索資料或微小的輸入變化而做出不同的反應。
- 新資產。訓練資料、模型權重、嵌入、提示、系統指令和推理 API 都可能成為攻擊者試圖竊取、篡改或操縱的物件。
- 人工智慧特有的故障模式。資料投毒、對抗樣本、模型提取、提示注入和基於記憶的洩漏與普通的軟體漏洞並不完全對應。
- 工具關聯的影響。當人工智慧系統能夠呼叫 API、讀取檔案、發送電子郵件、編寫程式碼或透過代理執行操作時,經過操縱的輸出可以成為真正的下游操作。
實際的教訓並非人工智慧需要一個獨立的安全體系。這意味著人工智慧系統需要傳統的控制措施,以及專門針對數據、模型、提示、工具、評估和監控的人工智慧控制措施。
人工智慧安全風險的常見類型
以下類別反映了對抗性機器學習研究、NIST 指南和 LLM 應用安全工作中使用的通用語言。在有用的情況下,它們被映射到 NIST 的對抗性機器學習分組:規避、投毒、隱私和誤用或濫用。
數據中毒
攻擊人工智慧——投毒。資料投毒是指惡意或竄改的資料進入訓練、微調或檢索管道。攻擊者可能會試圖降低準確率、製造偏差行為,或植入在特定條件下啟動的隱藏觸發器。
對抗性攻擊(規避)
對人工智慧的攻擊——規避。規避攻擊利用推理時精心建構的輸入,使模型產生錯誤的結果。這種變化在文字中可能很明顯,但在圖像、音訊或感測器資料中可能幾乎看不見。
快速注射和越獄
對人工智慧的攻擊-濫用/規避。提示注入利用惡意指令來覆寫或重定向模型的預期行為。在直接提示符號注入攻擊中,攻擊者將指令放入使用者提示符號中。在間接提示注入中,指令隱藏在模型讀取的內容中,例如網頁、文件、電子郵件、工單或工具回應。
敏感資料外洩和隱私洩露
對人工智慧的攻擊——隱私。人工智慧系統可能會透過訓練資料記憶、日誌、管理不善的提示、檢索系統或產生的輸出等方式洩露敏感資料。當員工將機密內容貼到未經授權的工具中,或人工智慧應用程式在沒有適當存取檢查的情況下檢索資料時,風險尤其高。
模型盜竊和提取
人工智慧攻擊——保密/隱私。模型竊盜包括竊取模型權重、透過反覆查詢複製託管模型的行為,或提取足夠的資訊來建構一個近似的替代品。這會威脅知識產權,並可能幫助攻擊者研究該模型以便將來濫用。
API 濫用和無限制消費
對人工智慧的攻擊——可用性和濫用。人工智慧系統通常透過應用程式介面(API)對外開放。薄弱的身份驗證、不合理的速率限制、不安全的整合或過多的權限都可能使攻擊者竊取資料、濫用運算能力、觸發代價高昂的推理或降低服務品質。OWASP 的 2025 年 LLM 風險清單將無限消費視為一個單獨的問題。
影子人工智慧
暴露風險——誤用。影子人工智慧是指在組織不可見的情況下使用未經批准的人工智慧工具、帳戶、代理或整合。這會造成風險,因為安全團隊無法對他們不知道正在使用的工具強制執行保留、存取控制、監控或資料遺失策略。
過度代理和代理型人工智慧的風險
對人工智慧的攻擊——濫用。當人工智慧系統或代理程式擁有超出其所需功能、權限或自主性時,就會出現過度自主性。當代理人可以呼叫工具、更改記錄、傳送訊息、移動檔案、編寫程式碼或跨業務系統執行操作時,風險就會增加。
- 目標劫持:攻擊者操縱智能體的目標。
- 權限過高的工具:代理可以讀取、寫入、刪除或傳輸超出任務要求的資料。
- 記憶體中毒:儲存的上下文被破壞,從而影響未來的決策。
- 不安全的自主行動:未經人類批准或獨立授權而發生的高影響行動。
惡意濫用
人工智慧作為攻擊工具——濫用。攻擊者可以利用人工智慧擴大網路釣魚規模、生成惡意軟體變種、編寫逼真的冒充資訊、創建深度偽造內容、自動偵察或製造虛假資訊。人工智慧系統本身可能沒有問題;風險在於如何使用其功能。
人工智慧攻擊生命週期
人工智慧安全不僅僅是推理時間的問題。從資料收集到部署、運行和退役,各個環節都可能出現風險。將風險對應到生命週期階段有助於團隊將控制措施應用到真正重要的環節。
生命週期視角可以避免一個常見的錯誤:將 AI 安全性視為提示過濾問題。過濾器雖然有幫助,但它們本身並不能保護訓練資料、模型權重、供應鏈、工具權限或監控管道。
人工智慧安全風險管理框架
多個權威框架為團隊提供了一種用於描述人工智慧安全風險的共同語言。它們對建構結構很有用,但它們不能取代對特定係統進行威脅建模。
- NIST AI風險管理架構(AI RMF 1.0)於2023年1月26日發布。它是以治理、規劃、衡量和管理為核心的自願性指導方針。
- NIST AI 600-1,即生成式人工智慧規範,於 2024 年 7 月 26 日發布,並於 2026 年 4 月 8 日更新。它是 AI RMF 1.0 的配套配置文件,用於生成式 AI 風險管理。
- NIST AI 100-2e2025 更新了 NIST 的對抗性機器學習分類,並討論了預測性和生成性 AI 系統中的規避、投毒、隱私和濫用/誤用攻擊。
- OWASP 2025 年 LLM 和 GenAI 應用十大風險涵蓋了應用層面的風險,例如快速注入、敏感資訊外洩、供應鏈風險、資料和模型中毒、過度代理、無限制消費和模型盜竊。
- NIST 網路安全框架 2.0 於 2024 年 2 月 26 日發布,可透過治理、識別、保護、偵測、回應和復原,協助將 AI 安全整合到更廣泛的網路安全治理中。
成熟的AI安全方案通常會借鏡多個框架:AI RMF 用於風險治理,對抗性 ML 分類法用於攻擊語言,OWASP 用於應用級 LLM 風險,CSF 用於與現有安全運營整合。
常見問題解答
人工智慧風險和人工智慧安全風險有什麼區別?
人工智慧風險是一個總括性類別。它包括安全風險、保障風險、法律風險、營運風險、道德風險、聲譽風險和社會風險。人工智慧安全風險的範圍更窄:它專注於對抗性攻擊、濫用以及對人工智慧系統、資料、模型、工具和輸出的保護。
人工智慧安全風險最常見的有哪些?
常見類別包括資料投毒、規避攻擊、快速注入、敏感資訊外洩、模型竊取、API 漏洞、影子人工智慧、過度代理以及濫用人工智慧進行網路釣魚、深度偽造、惡意軟體或偵察。
人工智慧安全與傳統網路安全有何不同?
傳統網路安全保護基礎架構、應用程式、身分和資料。AI 安全為 AI 特有的資產和行為提供保護:訓練資料、模型權重、嵌入、提示、推理 API、檢索系統和工具連接代理。
結論
人工智慧安全風險是指對人工智慧系統的對抗性攻擊以及將人工智慧濫用為攻擊工具。它們屬於更廣泛的人工智慧風險範疇,但它們值得擁有自己的詞彙,因為模型、訓練資料、提示、推理 API 和代理會創建攻擊面,而傳統的安全程序並非旨在單獨處理這些攻擊面。
最有效的安全策略是分層的:保護人工智慧的生命週期,限制模型和代理可以存取的內容,持續驗證行為,並將人工智慧特定的風險管理與已建立的網路安全治理聯繫起來。這為團隊提供了一種切實可行的方法來保護 AI,而無需假裝這個問題是全新的,或者已經被現有工具解決了。
This page was machine-translated. If you notice any inaccuracies or have feedback, please feel free to send it to us here.