[논문 리뷰] AttacKG: Constructing Technique Knowledge Graph from Cyber Threat Intelligence Reports
AttacKG는 비정형 사이버 위협 지능(Cyber Threat Intelligence, CTI) 보고서에서 공격 기법을 자동으로 추출하고 집계하여 기술 지식 그래프(Technique Knowledge Graph, TKG)를 구축하는 혁신적인 프레임워크이다. 자연어 처리(NLP) 기반의 실체 및 의존성 추출과 MITRE ATT&CK 템플릿에 대한 그래프 정렬을 융합함으로써, AttacKG는 높은 F1 점수(실체: 0.887, 의존성: 0.896, 기법: 0.789)를 달성하며, 1,515건의 보고서에서 총 28,262개의 공격 기법과 8,393개의 고유한 IoC를 식별하였다. 이는 이전의 최고 수준의 방법들보다 뚜렷이 뛰어난 성능을 보였다.
Cyber attacks are becoming more sophisticated and diverse, making detection increasingly challenging. To combat these attacks, security practitioners actively summarize and exchange their knowledge about attacks across organizations in the form of cyber threat intelligence (CTI) reports. However, as CTI reports written in natural language texts are not structured for automatic analysis, the report usage requires tedious manual efforts of cyber threat intelligence recovery. Additionally, individual reports typically cover only a limited aspect of attack patterns (techniques) and thus are insufficient to provide a comprehensive view of attacks with multiple variants. To take advantage of threat intelligence delivered by CTI reports, we propose AttacKG to automatically extract structured attack behavior graphs from CTI reports and identify the adopted attack techniques. We then aggregate cyber threat intelligence across reports to collect different aspects of techniques and enhance attack behavior graphs into technique knowledge graphs (TKGs). In our evaluation against 1,515 real-world CTI reports from diverse intelligence sources, AttacKG effectively identifies 28,262 attack techniques with 8,393 unique Indicators of Compromises (IoCs). To further verify the accuracy of AttacKG in extracting threat intelligence, we run AttacKG on 16 manually labeled CTI reports. Empirical results show that AttacKG accurately identifies attack-relevant entities, dependencies, and techniques with F1-scores of 0.887, 0.896, and 0.789, which outperforms the state-of-the-art approaches Extractor and TTPDrill. Moreover, the unique technique-level intelligence will directly benefit downstream security tasks that rely on technique specifications, e.g., APT detection and cyber attack reconstruction.
연구 동기 및 목표
- 비정형적이고 기계로 읽기 어려운 비정형 CTI 보고서에서 수작업으로 공격 지식을 복원하는 데 도전하는 것.
- 개별 보고서에서의 고립된 통찰에 한계가 있음을 고려하여, 기법 수준에서 여러 보고서에 걸쳐 위협 지능을 집계함으로써 이를 해결하는 것.
- 완전한 공격 체인과 풍부한 맥락적 및 행동적 세부 정보를 포괄하는 종합적이고 지식 기반의 공격 그래프—즉, 기술 지식 그래프(Technique Knowledge Graph, TKG)—를 구축하는 것.
- 도메인 플립과 같은 회피 기법에 더 강건한 대응이 가능한 기법 기반 위협 모델링으로의 전환을 통해 탐지의 강건성을 향상시키는 것.
- APT 탐지 및 공격 재구성과 같은 후속 보안 작업을 지원하기 위해 구조화되고 실행 가능한 기법 수준의 지능을 제공하는 것.
제안 방법
- NLP 기법을 사용하여 CTI 보고서에서 공격 관련 실체(예: CVE, IP 주소)와 그들의 의존성(예: 명령 및 제어 연결)을 추출하는 파이프라인.
- MITRE ATT&CK 지식 기반에서 실제 공격 절차 예시를 활용하여 기법 템플릿을 초기화하여 기준 패턴으로 활용.
- 노드 유사도, 최소 경로 거리, 노드 발생 빈도를 기반으로 노드 및 엣지 수준의 정렬 점수를 계산하는 개선된 그래프 정렬 알고리즘을 적용.
- 정렬 점수를 [0,1] 범위로 정규화하고 임계값과 비교하여 일치하는 부분 그래프를 식별함으로써, 실제 공격 행동을 표준화된 기법에 매핑하는 것.
- 정렬된 공격 그래프로부터 새로운 IoC와 자연어 기술 설명을 통합하여 기법 템플릿을 동적으로 업데이트함으로써 지속적인 지식 집계를 가능하게 함.
- 다중 보고서 및 다중 기법 통합을 지원하여, 다양한 행동 양태와 대체 공격 경로를 포괄하는 통합 TKG를 구축할 수 있도록 함.
실험 결과
연구 질문
- RQ1고정밀도와 고재현율을 확보하면서, 비정형 CTI 보고서에서 구조화된 공격 행동 그래프를 자동으로 추출할 수 있는가?
- RQ2여러 보고서의 공격 그래프가 표준화된 기법 템플릿과 얼마나 효과적으로 정렬되어 공통적인 악성 기법을 식별할 수 있는가?
- RQ3단일 보고서 분석에 비해, 보고서 간 지능 집계가 공격 기법 표현의 완전성과 정확도를 얼마나 향상시키는가?
- RQ4기존 최고 수준의 CTI 파싱 도구와 비교했을 때, 제안된 방법이 실체, 의존성, 기법 추출 성능에서 얼마나 뛰어나게 되는가?
- RQ5결과적으로 생성된 기술 지식 그래프(Technique Knowledge Graph, TKG)는 강화된 실행 가능한 지능을 제공함으로써 APT 탐지 및 공격 재구성과 같은 고급 보안 작업을 지원할 수 있는가?
주요 결과
- AttacKG는 공격 관련 실체 추출에 대해 F1 점수 0.887, 의존성 추출에 대해 0.896을 기록하여 Extractor 및 TTPDrill와 같은 기존 방법들을 초월하였다.
- 시스템은 공격 기법 식별에 대해 F1 점수 0.789를 달성하여 실제 공격 행동을 표준화된 기법에 매핑하는 데 있어 뛰어난 강건성을 입증하였다.
- 1,515건의 CTI 보고서에서 AttacKG는 총 28,262개의 고유한 공격 기법과 8,393개의 고유한 위협 지표(Indicators of Compromise, IoC)를 성공적으로 추출하였다.
- 그래프 정렬 알고리즘은 다양한 공격 그래프를 기법 템플릿에 효과적으로 매핑하여, 보고서 간 다양한 행동 양태와 대체 공격 경로의 집계를 가능하게 하였다.
- 기법 템플릿의 동적 업데이트 기능을 통해 IoC와 기술 설명 메타데이터가 지속적으로 풍부해지며 지식 기반의 질적 향상이 이루어졌다.
- 최종적으로 생성된 기술 지식 그래프(Technique Knowledge Graph, TKG)는 공격 체인을 종합적이고 인과관계 기반으로 표현하며, 고급 위협 탐지 및 대응 워크플로우를 지원한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.