2m read

데이터 중독 정의, 공격 유형 및 방어

이 페이지에서 확인할 수 있는 내용

Cato Networks, 2024 Gartner® Magic Quadrant™ 단일 벤더 SASE 부문 리더로 선정

보고서 다운로드

데이터 오염은 AI 또는 기계 학습 시스템이 학습하는 데이터에 대한 의도적인 공격입니다. 공격자가 라이브 애플리케이션을 직접 공격하는 대신, 데이터 세트, 레이블 세트, 검색 말뭉치 또는 훈련 파이프라인을 손상시켜 모델이 잘못된 패턴을 학습하게 하고, 이후 공격자의 목표에 맞게 행동하도록 만듭니다.

이것이 데이터 오염이 보안 및 AI 팀에게 어려운 이유입니다. 피해는 모델의 출력을 누군가가 보기 훨씬 이전에 심어질 수 있습니다. 오염된 모델은 표준 테스트에서 정상으로 보일 수 있으며, 광범위한 정확성 검사를 통과할 수 있지만, 공격자가 신경 쓰는 특정 사례에서는 여전히 실패할 수 있습니다.

짧은 정의: 데이터 오염은 AI 시스템이 오염된 행동을 학습하도록 훈련, 미세 조정, 레이블 지정 또는 검색 데이터를 의도적으로 조작하는 것입니다.

데이터 오염이 작동하는 방식

대부분의 오염 공격은 기술적 세부 사항이 모델 유형이나 데이터 출처에 따라 다르더라도 동일한 기본 패턴을 따릅니다.

  1. 공격자는 데이터 파이프라인으로 들어가는 경로를 찾습니다. 그 경로는 공개 데이터 세트, 스크랩된 웹 소스, 크라우드 레이블링 프로세스, 공급업체 제공 모델, 주석 도구 또는 RAG 시스템에서 사용하는 검색 말뭉치일 수 있습니다.
  2. 공격자는 데이터를 추가, 변경 또는 제거합니다. 그들은 레이블을 뒤집거나, 트리거 패턴을 삽입하거나, 예제의 분포를 왜곡하거나, 중요한 반례를 삭제하거나, 나중에 검색에 영향을 미치도록 설계된 지침이 포함된 문서를 심을 수 있습니다.
  3. 모델은 오염된 데이터로부터 학습합니다. 훈련 또는 미세 조정 중에 시스템은 공격자가 제어하는 패턴을 합법적인 증거로 간주합니다.
  4. 피해는 나중에 드러납니다. 모델은 덜 정확해지거나, 더 편향되거나, 특정 조건에서만 활성화되는 숨겨진 트리거에 취약해질 수 있습니다.

공격자는 종종 최종 배포된 애플리케이션에 접근할 필요가 없습니다. 그들이 상류 데이터에 영향을 미칠 수 있다면, 생산에 손대지 않고도 완성된 모델에 영향을 미칠 수 있습니다.

우연한 데이터 손상과의 차이점

잘못된 데이터는 흔하다. 파일이 손상되고, 레이블이 잘못되며, 출처가 흐트러지고, 중복이 발생하며, 엣지 케이스가 누락된다. 이것들은 데이터 품질 문제이다. 데이터 오염은 다르다. 왜냐하면 그 오염이 의도적이고 적대적이기 때문이다.

그 구분은 대응 방식을 변화시킨다. 우발적인 오염은 일반적으로 품질 검사, 검증 및 정리로 처리된다. 데이터 오염은 보안 사고를 요구한다: 출처, 접근 제어, 위협 모델링, 감사 추적, 이상 탐지, 그리고 일부 입력이 적대적일 수 있다는 가정이 필요하다.

데이터 오염 공격의 유형

오염 공격은 일반적으로 공격자의 목표에 따라 그룹화된다. 일부는 모델을 광범위하게 저하시킨다. 다른 것들은 훨씬 더 정밀하여, 그래서 더 알아차리기 어려울 수 있다.

레이블 전환 공격

레이블 전환 공격에서는 공격자가 선택된 훈련 예제의 레이블을 변경한다. 스팸이 합법적인 것으로 표시된다. 사기가 정상으로 표시된다. 악의적인 샘플이 안전한 것으로 표시된다. 그런 다음 모델은 입력과 결과 사이의 잘못된 관계를 학습한다.

백도어 또는 트로이 공격

백도어 공격은 모델이 대부분의 시간에 정상적으로 작동하도록 가르치지만, 트리거가 나타날 때 실패하도록 한다. 트리거는 이미지의 시각적 표시, 텍스트의 구문, 파일의 패턴, 또는 공격자가 제어하는 다른 신호일 수 있다. BadNets는 모델이 숨겨진 백도어를 가지고 있으면서도 강력한 클린 성능을 유지할 수 있는 방법을 보여줌으로써 이 공격 유형을 잘 알려지게 했습니다.

목표화된 오염

목표화된 오염은 특정 입력에 대한 모델의 행동을 변경하면서 일반적인 성능은 대체로 유지합니다. 이것은 방어자들이 가장 걱정하는 버전입니다. 왜냐하면 일반적인 대시보드가 전반적인 정확도가 건강하게 보일 수 있지만, 모델이 좁고 높은 가치의 경우에서 조용히 잘못될 수 있기 때문입니다.

가용성 공격

가용성 공격은 덜 미묘합니다. 목표는 모델 성능을 충분히 낮추어 시스템이 신뢰할 수 없거나 사용할 수 없게 만드는 것입니다. 이러한 공격은 실패가 여러 경우에서 가시적이기 때문에 목표화된 오염보다 탐지하기가 더 쉽습니다.

RAG 시스템에서의 검색 오염

현대 LLM 애플리케이션은 종종 검색 보강 생성(RAG)을 사용하며, 여기서 모델은 응답하기 전에 외부 지식 기반을 참조합니다. 이는 또 다른 오염 표면을 생성합니다. 악의적인 문서가 검색 코퍼스에 들어가면, 모델은 나중에 이를 검색하고 신뢰할 수 있는 맥락으로 취급할 수 있습니다.

SilentRetrieval과 같은 공격에 대한 최근 연구는 이것이 왜 중요한지를 보여줍니다: 오염된 문서는 유창하고 관련성 있게 보이도록 작성될 수 있어, 간단한 품질 검사가 약한 방어가 됩니다. RAG 시스템의 경우, 데이터셋은 원래의 훈련 세트만이 아닙니다. 추론 시 모델이 읽는 지식 기반도 포함됩니다.

오염이 AI 생애 주기에 들어갈 수 있는 곳

일반적인 실수는 오염이 모델 훈련 중에만 발생하는 것으로 상상하는 것입니다. 실제로 오염은 데이터가 수집, 레이블링, 이동, 변환 또는 검색되는 거의 모든 곳에 들어갈 수 있습니다.

  • 수집: 원본 데이터, 스크랩된 데이터, 공개 데이터셋, 사용자 제출 기록 또는 센서 피드를 오염시키는 것입니다.
  • 주석: 인간 레이블, 크라우드 소싱 레이블 또는 공급업체 레이블링 워크플로를 조작하는 것입니다.
  • 집계: 여러 출처에서 결합된 데이터를 조작하는 것.
  • 전처리: 정리, 변환, 중복 제거 또는 특성 공학 중에 데이터를 변경하는 것.
  • 훈련 및 미세 조정: 모델을 훈련시키거나 기존 모델을 조정하는 데 사용되는 데이터를 오염시키는 것.
  • 검색: RAG 시스템이 사용 중에 쿼리하는 말뭉치에 적대적인 문서를 추가하는 것.

이 생애 주기 관점은 중요합니다. 훈련 단계에만 방어가 배치되면 이전에 들어온 공격을 놓치게 됩니다. RAG는 또 다른 격차를 만듭니다: 공격은 배포 후 모델이 검색하는 자료를 통해 나중에 들어올 수 있습니다.

데이터 오염 탐지가 어려운 이유

가장 어려운 오염 공격은 모델이 건강해 보이도록 설계됩니다. 전체 정확도가 떨어지지 않을 수 있습니다. 검증 테스트가 통과할 수 있습니다. 오염된 행동은 트리거, 대상 클래스 또는 좁은 입력 패턴이 존재할 때만 나타날 수 있습니다.

이것이 연구 사례가 유용한 이유이지만, 신중한 해석이 필요합니다. 백도어 연구는 모델이 깨끗한 입력에서 잘 작동하면서 트리거된 입력에서는 실패할 수 있음을 보여줍니다. RAG 오염 작업은 악의적인 검색 문서를 단순한 유창성 또는 당혹감 검사로 표시하기 어려울 수 있음을 보여줍니다. 실용적인 교훈은 탐지가 불가능하다는 것이 아니라, 탐지만으로는 충분하지 않다는 것입니다.

경고 신호에는 다음이 포함될 수 있습니다:

  • 알려진 데이터, 모델 또는 코드 변경으로 설명할 수 없는 갑작스러운 정확도 하락.
  • 그룹, 클래스 또는 입력 유형 간의 예상치 못한 편향 또는 일관되지 않은 성능.
  • 특정 클래스, 구문, 특성, 출처 또는 문서 계열에 집중된 오분류.
  • 광범위한 테스트에서 정상적으로 작동하지만 좁은 트리거 조건에서 반복적으로 실패하는 모델.

데이터 오염은 유사한 용어가 자주 느슨하게 사용되는 적대적 AI의 더 넓은 분야에 속합니다. 가장 명확한 구분은 타이밍입니다: 데이터 오염은 시스템이 학습하는 내용을 손상시키고, 많은 다른 공격은 사용 중 시스템의 동작 방식을 조작합니다.

위협 데이터 오염과의 차이점
프롬프트 주입 LLM의 지침이나 맥락에 대한 런타임 공격입니다. 데이터 오염은 학습 데이터나 검색 데이터를 변경합니다.
적대적 예시 입력은 훈련된 모델을 속이기 위해 추론 시점에 조작됩니다. 오염은 학습 전이나 학습 중에 데이터를 변경합니다.
모델 오염 공격자는 모델 매개변수, 기울기 또는 업데이트를 직접 변경합니다. 데이터 오염은 모델이 학습하는 데이터를 통해 작동합니다.
모델 도용 공격자는 모델을 추출하거나 모방합니다. 오염은 모델의 동작을 손상시킵니다.
데이터 손상 데이터는 우연히 잘못될 수 있습니다. 오염은 의도적이며 적대적입니다.

짧은 버전: 데이터 오염은 학습 전이나 학습 중에 발생하며, 프롬프트 주입 및 적대적 예시는 사용 중에 발생합니다.

데이터 오염을 방지하고 완화하는 방법

모델이 오염된 데이터로부터 학습한 후에는 정리가 어려우므로, 가장 좋은 방어책은 훈련 전에 시작하여 배포까지 계속됩니다. 목표는 데이터의 영향을 가시화하고, 통제하며, 가능할 경우 되돌릴 수 있도록 하는 것입니다.

훈련 전

  • 데이터 출처를 추적하여 팀이 기록이 어디에서 왔는지, 어떤 출처가 신뢰할 수 있는지를 알 수 있도록 합니다.
  • 특히 공개 데이터셋, 스크랩된 콘텐츠, 사용자 제출물 및 제3자 데이터 피드를 수집할 때 데이터를 검증하고 정화합니다.
  • 오픈 소스 데이터셋, 사전 훈련된 모델 및 공급업체 제공 모델을 검토가 필요한 공급망 입력으로 취급합니다.
  • 훈련 데이터에 추가, 재레이블, 삭제 또는 승인할 수 있는 사람을 제한합니다.
  • 데이터셋 변경, 레이블 결정 및 파이프라인 업데이트에 대한 감사 로그를 유지합니다.

훈련 및 평가 중

  • 전체 정확도뿐만 아니라 여러 슬라이스에서 성능을 테스트합니다.
  • 의심스러운 클러스터, 중복 패턴, 레이블 이상 및 출처별 행동을 찾습니다.
  • 생산 훈련으로 승격하기 전에 새로운 데이터 소스를 그림자 훈련하거나 단계적으로 진행합니다.
  • 모델이 민감한 결정을 지원할 곳에서 백도어 및 트리거 테스트를 사용합니다.

RAG 및 LLM 시스템을 위해

  • 문서가 검색 코퍼스에 들어가기 전에 숨겨진 프롬프트 및 잘못된 형식의 콘텐츠를 포함하여 스크리닝합니다.
  • 모든 검색된 구절을 동등하게 취급하기보다는 출처 순위, 접근 제어 및 문서 신뢰 등급을 사용합니다.
  • 적절한 경우 어휘 검색과 벡터 검색을 결합하여 하나의 검색 방법이 영향을 미치는 유일한 경로가 되지 않도록 합니다.
  • 구절을 분리하고 여러 출처를 비교하며 단일 검색된 문서가 높은 영향력의 답변을 유도하지 않도록 합니다.

실용적인 원리는 간단합니다: 데이터 오염은 모델 보안 문제만큼이나 데이터 거버넌스 및 공급망 문제입니다. 이는 약한 출처, 느슨한 접근, 불완전한 검토 및 신뢰할 수 없는 입력을 종종 이용하며, 이국적인 모델 아키텍처 결함보다 더 자주 발생합니다.

데이터 오염과 법률

데이터 오염의 법적 지위는 사실에 따라 달라집니다: 의도, 승인, 관할권, 영향을 받는 시스템 및 초래된 피해. 무단으로 시스템이나 데이터셋에 간섭하는 것은 컴퓨터 오용, 사기, 계약, 지적 재산권 또는 특정 분야의 규칙에 따라 형사 또는 민사적 노출을 초래할 수 있습니다.

사람들이 의도적으로 자신의 공개 콘텐츠를 변경하여 허가 없이 이를 스크랩하는 모델이 저하된 패턴을 학습하도록 하는 것에 대한 별도의 논의도 있습니다. 일부는 이를 무단 스크래핑에 대한 자기 방어로 설명하지만, 다른 이들은 여전히 법적 및 운영적 위험을 초래할 수 있다고 주장합니다. 그 질문은 해결되지 않았으므로, 조직은 이를 순수한 기술적 전술이 아닌 법적 검토 문제로 다루어야 합니다.

자주 하는 질문

데이터 오염의 예는 무엇입니까?

간단한 예는 이메일에 대해 훈련된 스팸 필터로, 일부 스팸 메시지가 의도적으로 합법적인 것으로 라벨링됩니다. 더 발전된 예는 특정 트리거가 나타날 때를 제외하고는 정상적으로 작동하는 백도어 이미지 분류기입니다.

데이터 오염의 증상은 무엇입니까?

증상으로는 설명할 수 없는 정확도 감소, 예상치 못한 편향, 비정상적인 오분류 패턴 또는 특정 트리거와 관련된 실패가 포함될 수 있습니다. 표적 및 백도어 공격은 광범위한 성능 점검에서 몇 가지 증상을 보일 수 있습니다.

데이터 오염은 프롬프트 주입과 어떻게 다릅니까?

데이터 오염은 모델이 데이터에서 학습하는 내용을 변경합니다. 프롬프트 주입은 사용 중 LLM의 지시사항이나 맥락을 조작합니다. 하나는 학습 과정을 공격하고, 다른 하나는 런타임 동작을 공격합니다.

데이터 오염이 대형 언어 모델에 영향을 미칠 수 있습니까?

예. LLM 시스템은 사전 훈련 데이터, 미세 조정 데이터셋, 검색 코퍼스, 연결된 도구 및 외부 지식 출처를 통해 영향을 받을 수 있습니다. RAG 시스템은 문서 신뢰가 약할 때 특히 노출됩니다.

결론

데이터 오염은 학습 과정에 대한 공격입니다. 그 강점은 레버리지에서 옵니다: 소량의 나쁜 데이터가 나중에 대규모로 결정을 내리는 모델에 영향을 줄 수 있습니다. 그 위험은 타이밍에서 옵니다: 타협은 상류에서 심어질 수 있으며, 모델이 이미 사용 중일 때만 발견됩니다.

최고의 방어는 단일 탐지기가 아닙니다. 그것은 규율 있는 데이터 거버넌스입니다: 신뢰할 수 있는 출처, 통제된 접근, 데이터셋 감사 추적, 슬라이스 수준 테스트, RAG 말뭉치 검토, 그리고 배포 후 지속적인 모니터링입니다. AI 시스템을 구축하거나 구매하는 팀에게 데이터 오염은 모델 보안이 모델이 답을 생성하기 전에 시작된다는 것을 상기시킵니다.

Cato Networks, 2024 Gartner® Magic Quadrant™ 단일 벤더 SASE 부문 리더로 선정

보고서 다운로드

This page was machine-translated. If you notice any inaccuracies or have feedback, please feel free to send it to us here.