Cato의 자가 진화형 취약점 보호 에이전트로 보호 적용 시간 단축하기
TL;DR: 프론티어 AI 모델의 시대가 도래함에 따라 취약점 발견과 익스플로잇 발전은 인간이 수동으로 대응할 수 있는 속도보다 더 빠르게 이루어지고 있습니다. 이미 보안 팀은 증가한 CVE 물량, 더 빨라진 공격 창, 그리고 취약점 연구, 보호 규칙 생성, 검증, 배포 준비를 위한 수작업 중심의 워크플로에 직면하고 있습니다. 조직이 패치를 적용하는 속도보다 더 빠르게 공격자가 취약점을 무기화함에 따라 보호 적용 시간은 중요한 보안 지표가 되고 있습니다.
Cato는 CVE 공개부터 고객 보호까지의 경로를 가속화하기 위해 멀티모달 취약점 보호 자가 진화형 에이전트를 구축했습니다. 두 단계의 파일럿에서 에이전트는 여러 유형의 취약점에 대해 사용 가능한 보호 규칙을 일관되게 생성했습니다. 1차 파일럿에서 생성된 여러 보호 규칙은 이미 프로덕션 환경에 배포된 보호 규칙과 동등하거나 능가하는 성능을 보였습니다. 워크플로 개선 후 진행된 2차 파일럿에서는 평가된 여섯 개 CVE 모두에 대해 사용 가능한 시그니처가 생성되었으며, 최단 완료 시간은 45분이었습니다. 이 블로그에서는 검증 피드백, 감사 로그, 연구자 검토를 통해 개선되는 특정 모델 종속되지 않는 범용 에이전트 기반 워크플로를 평가한 방법론, 결과, 주요 인사이트를 소개합니다.
CVE 보호 에이전트 워크플로
워크플로의 목표는 보안 연구자의 최종 결정 권한을 유지하는 가운데 새로 공개된 취약점을 가능한 한 빨리 검증된 보호 규칙으로 전환하는 것입니다.
상위 수준에서 보면 이 워크플로는 학습 및 개선 루프를 포함한 다음의 다섯 단계로 구성됩니다.
- 취약점 정보 수집
- 익스플로잇 분석
- 보호 규칙 생성
- 검증
- 연구자 검토
이 워크플로는 벤더 보안 권고사항, CVE 기록, 신뢰할 수 있는 공개 및 비공개 저장소, 스크린샷, 기술 다이어그램 등 다양한 유형의 보안 아티팩트를 분석할 수 있는 기능과 여러 AI 모델을 결합합니다. 이를 통해 에이전트는 보호 규칙을 생성하고 검증하기 전에 취약점에 대해 폭넓게 이해할 수 있습니다. 그림 1은 취약점 분석부터 검증 및 연구자 검토에 이르기까지 에이전트 기반 CVE 보호 워크플로의 상위 수준 개요를 보여줍니다.
그림 1. 멀티모달 CVE 보호 상위 수준 에이전트 워크플로
멀티모델 및 멀티모달 설계
워크플로는 멀티모델 및 멀티모달로 구성됩니다. 멀티모델인 이유는 작업의 복잡도에 따라 다양한 AI 모델을 사용할 수 있기 때문입니다. 멀티모달인 이유는 권고사항, 소스 코드, 스크린샷, 기술 다이어그램, 개념 증명 익스플로잇 등 다양한 유형의 보안 아티팩트를 분석할 수 있기 때문입니다.
주요 설계 목표 중 하나는 유연성이었습니다. 취약점 연구의 단계마다 서로 다른 추론 능력이 요구되므로 모든 작업에 동일한 모델을 사용하는 것은 비효율적입니다. 평가 과정에서 주로 Claude Sonnet 4.6과 Claude Opus 4.7을 사용했으며, Claude Opus 4.8과 OpenAI GPT-5.5-Cyber가 출시된 직후부터 이들에 대한 평가도 시작했습니다.
메타데이터 추출, 자문용 구문 분석, 워크플로 오케스트레이션과 같은 작업은 비용이 더 저렴한 모델로 효율적으로 처리할 수 있습니다. 익스플로잇 분석, 시그니처 생성, 검증 개선 등의 복잡한 작업은 추론 성능이 강력한 모델을 사용하면 더 좋은 결과를 얻을 수 있습니다. 의도적으로 특정 모델에 구애받지 않는 아키텍처를 채택하여 기반 모델이 개선되면 기본 시스템을 재설계할 필요없이 해당 개선 사항을 워크플로에 반영할 수 있습니다.
내부적으로 에이전트는 엔드 투 엔드 워크플로 전반에 걸쳐 16개 단계 및 하위 에이전트를 조정하는 오케스트레이션 레이어에 의해 관리됩니다. 또한 각 하위 에이전트는 추가적인 하위 에이전트를 병렬로 트리거하여 효율성을 높일 수 있습니다. 무결성 게이트는 각 단계가 예상대로 완료되었는지 검증하며, 요구되는 기준을 충족하지 못한 단계는 검증을 통과할 때까지 자동으로 재시작됩니다.
시그니처 생성은 범용 모델만으로 수행되지 않습니다. 워크플로는 Cato의 축적된 보안 연구 지식, 탐지 로직, IPS 시그니처 패턴, 우회 기법, 검증 경험을 학습한 전문 에이전트를 사용합니다. 각 에이전트는 원격 코드 실행, 인증 우회, 경로 탐색, 서비스 거부, 정보 유출, 일반적인 악용과 같은 특정 취약점 유형을 전문적으로 다루도록 설계되었습니다. 이러한 유형별 전문화 덕분에 워크플로는 획일적인 방식에 의존하지 않고 취약점 유형별로 더 강력한 보호 규칙을 생성할 수 있습니다.
또한 이 워크플로는 CVE 권고사항, 벤더 공개, 보안 연구 블로그, 신뢰할 수 있는 공개 및 비공개 저장소, 기술 다이어그램, 이미지, 스크린샷을 포함한 여러 출처와 형식의 정보를 분석하도록 설계되었습니다. 이러한 입력 정보를 결합하면 에이전트는 보호 규칙 후보를 생성하기 전에 취약점의 동작 특성을 더 심층적으로 이해할 수 있습니다.
검증은 이 워크플로의 핵심 요소이며, 사후 고려 사항이 아닙니다. 생성된 보호 규칙은 Cato 데이터 웨어하우스의 최신 실제 트래픽 데이터를 대상으로 오탐지와 미탐지 여부를 테스트합니다. 이는 보호 기능이 정상적인 트래픽을 차단하지 않고 관련 공격 변형을 탐지하는지 확인하는 데 도움이 됩니다.
마지막으로, 이 워크플로는 검증 결과, 연구자 검토, 실행 추적, 감사 로그에서 생성된 피드백 루프를 통해 개선됩니다. 이러한 인사이트는 시간이 지남에 따라 프롬프트, 기술, 워크플로 로직, 전문 에이전트, 모델 라우팅 결정을 개선하는 데 사용됩니다.
운영 피드백을 통한 자기 진화
멀티모달 CVE 보호 에이전트의 주요 설계 원칙은 지속적인 개선입니다. 에이전트가 엔드 투 엔드 워크플로를 완료하고 풀 리퀘스트를 생성할 때마다 보안 연구자는 제안된 보호 규칙을 검토하고 보완이 필요할 때 피드백을 제공합니다. 수정 사항은 연구자에 의해 수동으로 적용되거나 지원 에이전트를 통해 자동으로 적용될 수 있습니다.
피드백 프로세스는 단일 풀 리퀘스트로 끝나지 않습니다. 정기적으로 실행되는 자동화된 학습 워크플로가 완료된 풀 리퀘스트, 검토자 의견, 해결된 문제를 분석합니다. 시스템은 에이전트가 처음 생성한 보호 규칙과 최종 승인 버전을 비교하여 반복되는 실수, 누락된 로직, 개선 기회를 파악합니다. 그런 다음 이러한 통찰은 에이전트가 사용하는 기술, 워크플로, 검증 로직, 지식을 업데이트하는 데 사용되어 향후 실행 시 유사한 오류를 줄이는 데 도움을 줍니다.
그 결과, 에이전트는 정지 상태로 머물지 않습니다. 각 리뷰 주기는 보호 규칙 품질을 개선하고 향후 조사를 가속화하며 엔드 투 엔드 취약점 연구 프로세스를 지속적으로 개선하는 기회가 됩니다.
연구 방법
멀티모달 CVE 보호 에이전트의 효과를 평가하기 위해 여러 취약점 범주에 걸쳐 파일럿 연구를 수행했습니다. 평가는 6개의 주요 공격 유형에 해당하는 20개의 실제 취약점을 대상으로 진행되었습니다. 1차 파일럿에서는 보호 규칙이 이미 존재하는 CVE를 사용하여 6개의 주요 공격 유형에 걸쳐 14개의 실제 취약점을 평가했습니다. 이를 통해 에이전트가 생성한 보호 규칙을 실제 프로덕션 환경에서 사용 중인 기존 보호 규칙과 비교할 수 있었습니다. 2차 파일럿에서는 1차 파일럿을 기반으로 워크플로를 개선한 후, 당사 환경에서 기존 보호 규칙이 없는 6개의 추가적인 CVE를 대상으로 평가를 수행했습니다. 2차 파일럿의 이러한 CVE들은 RCE, 인증 우회, 경로 탐색을 포함한 동일한 취약점 유형에 일부 해당되었지만, 모든 취약점 유형을 하나씩 평가하기 위한 것은 아니었습니다.
표 1은 파일럿에 포함된 취약점 범주와 각 범주에서 테스트된 CVE의 수를 요약한 것입니다.
표 1. 파일럿 평가에 포함된 취약점 범주
평가 프로세스
각 취약점에 대해 에이전트는 사용 가능한 취약점 정보를 분석하고 보호 규칙 후보를 생성한 후 제공된 텔레메트리 데이터와 테스트 워크플로를 활용하여 그 결과를 검증했습니다.
평가 방식은 두 파일럿 단계 사이에 약간의 차이가 있었습니다. 1차 파일럿에서는 테스트 환경에서 기존 보호 규칙을 제거한 후, 에이전트가 생성한 보호 규칙을 프로덕션 환경에서 이미 사용 중인 보호 규칙과 비교했습니다. 2차 파일럿에서는 기존 보호 규칙 없이 취약점을 대상으로 워크플로를 테스트하여 새로운 실제 환경에서 개선된 워크플로를 평가할 수 있었습니다.
2회에 걸친 평가에서 보호 적용 시간, 보호 품질, 연구자의 개입 수준을 측정했습니다.
결과
그림 2는 여러 공격 유형에 걸친 14개의 취약점을 대상으로 수행한 1차 파일럿 평가를 요약한 것입니다. 이 그림은 실행 시간, CVE당 최소 시간, 보호 품질, 워크플로 성공률을 보여줍니다.
그림 2. 1차 에이전트 기반 CVE 파이프라인 파일럿 결과
파일럿 평가 결과에 따르면 에이전트 기반 워크플로는 다양한 CVE 데이터 세트 전반에 걸쳐 일관된 처리 시간과 보호 품질을 유지하며 보호 조치를 생성할 수 있었습니다.
표 2는 주요 1차 파일럿 평가 지표를 요약한 것입니다.
표 2: 1차 파일럿 평가 요약
2차 파일럿 결과
1차 파일럿 평가를 기반으로 워크플로를 개선한 후, 기존 보호 규칙이 없던 6개의 취약점을 대상으로 에이전트를 평가했습니다.
그림 3은 결과를 요약한 것입니다. 2차 파일럿(CVE 6개)에서 당사 CVE 에이전트는 모든 취약점에 대해 사용 가능한 취약점 시그니처를 생성했으며, CVE당 최단 처리 시간은 45분이었습니다.
그림 3. 2차 에이전트 기반 CVE 파이프라인 결과
주요 결과
빠르고 효율적
두 파일럿 모두에서 워크플로는 며칠이 아닌 몇 시간 만에 보호 규칙을 생성했습니다. 이 결과는 수작업으로 보호 규칙을 생성하는 경우 일반적으로 전문 보안 연구자가 취약점 분석, 탐지 로직 설계, 검증, 검토, 개선 등의 작업을 수행하는 데 상당한 시간을 투입해야 한다는 점에서 중요한 의미를 가집니다. 1차 파일럿에서 최단 보호 적용 시간은 45분이었습니다. 워크플로 개선 후, 2차 파일럿에서는 평가된 6개 CVE 모두에 대해 사용 가능한 시그니처를 생성했습니다. 한 시간 이내에 여러 보호 규칙을 생성했으며 최단 완료 시간은 45분이었습니다.
높은 성공률
이 워크플로는 평가 대상이 된 거의 모든 취약점에 대해 사용 가능한 보호 규칙을 성공적으로 생성했습니다. 1차 파일럿에서 생성된 여러 보호 규칙은 이미 프로덕션 환경에 배포된 보호 규칙과 동등하거나 능가하는 성능을 보였습니다. 2차 파일럿에서 에이전트는 새로 공개된 6개 CVE 모두에 대해 사용 가능한 취약점 시그니처를 생성했습니다.
일관되고 예측 가능
2회의 파일럿은 여러 취약점 유형에 대해 재현 가능한 동작을 보여주었으며, 실행 시간은 예외적인 일부 성공 사례에만 의존한 결과가 아니라 실용적인 범위 내에서 안정적으로 유지되었습니다.
안전 제어 기능이 의도한 대로 작동
한 사례에서는 공개된 익스플로잇 정보가 충분하지 않았기 때문에 워크플로의 진행이 정상적으로 중단되었습니다. 이는 자율 보안 워크플로에서 정책 집행 및 가드레일이 얼마나 중요한지를 보여주는 사례였습니다.
표 3은 전체 파일럿 평가 데이터 세트와 결과를 제시합니다.
표 3: 1차 평가 파일럿 평가 데이터 세트 및 결과
표 4는 2차 파일럿의 결과를 요약한 것입니다.
표 4: 개선된 워크플로를 사용한 2차 파일럿 결과
보호 품질 분석
이 평가는 속도뿐 아니라 생성된 보호 규칙이 정확하고 효율적이며 연구자가 검토하기에 적합한지를 중점적으로 다루었습니다. 파일럿 전반에 걸쳐 생성된 여러 보호 규칙은 프로덕션 수준의 품질에 도달했으며, 일부는 제한적인 수정만 거치면 승인될 수준이었습니다.
에이전트는 공격 변형, 인코딩 방식 차이, 시그니처의 구체성, 오탐지 감소와 같은 중요한 탐지 고려 사항을 반영할 수 있었습니다. 이를 통해 보호 규칙을 신속하게 생성할 수 있을 뿐 아니라 실제 운영 환경에서도 효과적으로 적용할 수 있는 수준임을 확인할 수 있었습니다.
이러한 결과는 보안 연구자가 최종 검증과 승인에 대한 통제권을 유지하도록 하는 가운데 에이전트 기반 취약점 연구가 더욱 빠르고 효율적인 보호 규칙 개발에 기여할 수 있음을 시사합니다.
Claude Opus 4.8 초기 평가
모델 비의존 아키텍처의 장점 중 하나는 새로운 기초 모델이 출시되는 즉시 신속하게 채택할 수 있다는 것입니다.
Claude Opus 4.8이 2026년 5월 28일에 공개된 직후, 앞서 다룬 cPanel 취약점인 CVE-2026-41940을 사용하여 이 모델을 평가했습니다. 표 5는 이 Claude Opus 4.8 초기 평가 결과를 보여줍니다.
표 5: Claude Opus 4.8 초기 평가
워크플로는 첫 실행에서 1시간 이내에 고품질 보호 규칙을 생성했습니다.
플랫폼이 중요한 이유
에이전트 기반 취약점 보호 규칙의 효과는 기반 AI 모델만으로 결정되지 않습니다. 모델은 취약점을 분석하거나 보호 규칙 후보를 생성하는 데 도움을 줄 수 있지만, 진정한 가치는 그 모델을 중심으로 구축된 아키텍처, 오케스트레이션, 검증, 피드백 루프, 신속하고 안전하게 대규모로 보호 규칙을 제공할 수 있는 능력에서 나옵니다.
Cato의 클라우드 네이티브 아키텍처는 고객이 조치를 취할 필요 없이 멀티모달 CVE 보호 에이전트가 취약점 분석에서 고객 보호까지 수행할 수 있도록 지원합니다. 새로운 보호 규칙은 실제 트래픽 데이터를 기반으로 검증된 후, Cato의 글로벌 PoP 네트워크 전반에 배포되고, 유지보수 시간, 어플라이언스 업데이트, 수동 개입 없이 통합 보안 플랫폼을 통해 제공될 수 있습니다. 이는 The Mythos Moment에서 논의한 근본적인 원칙을 한 번 더 확인해줍니다. 즉, AI의 장기적인 가치는 기초 모델뿐만 아니라 그 모델을 중심으로 구축된 아키텍처, 오케스트레이션, 피드백 루프에서 비롯된다는 것입니다.
논의 및 결론
파일럿 및 후속 연구에 따르면 에이전트 기반 취약점 연구는 여러 취약점 유형에 대한 보호 적용 시간을 유의미하게 줄일 수 있는 것으로 밝혀졌습니다. 멀티모달 CVE 보호 에이전트는 실행 시간을 예측 가능한 수준으로 유지하고 비용을 합리적으로 관리하면서 높은 품질의 보호 규칙을 생성했습니다. 이 연구는 병목이 발생하는 위치가 이동하고 있다는 또 다른 중요한 사실도 알려줬습니다. 이제 가장 어려운 과제는 보호 규칙을 생성하는 것이 아니라 이를 대규모 환경에서 안전하게 검증하고 운영에 적용하는 것이며, 이 과정에서 플랫폼 아키텍처, 실제 운영 환경의 텔레메트리 데이터, 보안 연구자의 감독이 핵심적인 역할을 한다는 것입니다.
이제 더 이상 파일럿 단계에 머물러 있지 않습니다. Cato 연구자들은 이미 이 워크플로를 사용하여 고객에게 더 빠르고 강력한 보호 규칙을 제공하고 있습니다. 인간의 전문성은 프로세스의 중심에 남아 있으며, 연구자들은 결과를 검토하고 복잡한 사례를 검증하며 필요할 때 최종 탐지 결정을 내리는 한편, 에이전트는 반복적인 연구 및 엔지니어링 작업을 기계 수준의 규모로 자동화합니다. 기초 모델이 계속 발전하는 가운데 이러한 모델 비의존 아키텍처는 발전하는 AI 기술을 활용해 더 신속한 고객 보호를 가능케 하는 실용적인 경로를 제공합니다.