[논문 리뷰] EXTRACTOR: Extracting Attack Behavior from Threat Reports
Extractor는 자연어처리(NLP) 기반의 신규 도구로, 시스템 수준의 동작, 엔티티 및 인과적 의존 관계를 나타내는 유전적 그래프를 구성함으로써 비구조화된 사이버 위협 지능(CTI) 보고서에서 요약되고 실행 가능한 공격 행동을 자동으로 추출한다. 텍스트의 장황함, 복잡성 및 관계 추출 과제를 해결하기 위해 텍스트 요약, 문법적 변환 및 의미역할라벨링(SRL)을 조합한 파이프라인을 사용하여 전문가가 애너테이션한 보고서와 검증된 고정밀 그래프 추출을 달성하며, 위협 사냥 워크플로우에서 직접 사용 가능하다.
The knowledge on attacks contained in Cyber Threat Intelligence (CTI) reports is very important to effectively identify and quickly respond to cyber threats. However, this knowledge is often embedded in large amounts of text, and therefore difficult to use effectively. To address this challenge, we propose a novel approach and tool called EXTRACTOR that allows precise automatic extraction of concise attack behaviors from CTI reports. EXTRACTOR makes no strong assumptions about the text and is capable of extracting attack behaviors as provenance graphs from unstructured text. We evaluate EXTRACTOR using real-world incident reports from various sources as well as reports of DARPA adversarial engagements that involve several attack campaigns on various OS platforms of Windows, Linux, and FreeBSD. Our evaluation results show that EXTRACTOR can extract concise provenance graphs from CTI reports and show that these graphs can successfully be used by cyber-analytics tools in threat-hunting.
연구 동기 및 목표
- 장황하고 비구조화된 CTI 보고서에서 종합적이고 구조화된 공격 행동을 추출하는 데 도전하는 것.
- 이전 연구에서 인과적, 시간적 또는 정보 흐름 관계를 포착하지 못하는 단일 IOCs나 위협 행동에만 집중하는 한계를 극복하는 것.
- 위협 탐지 및 분석에 직접 사용 가능한 기계가 읽을 수 있는 실행 가능한 지능 형태로 유전적 그래프를 생성하는 것.
- 다양한 출처에서 온 대규모 CTI 보고서, 블로그 및 사고 보고서(실제 사례 및 DARPA 적대적 참여 보고서 포함)의 처리를 스케일링하는 것.
- 자연어에서 '누가, 무엇을, 누구한테, 언제, 어디서' 수행했는지의 서사 구조를 반영하는 자동화되고 정밀하며 의미적으로 풍부한 공격 행동 추출을 가능하게 하는 것.
제안 방법
- 비효율적인 텍스트에서 공격 관련 내용을 분리하여 복잡성을 줄이고 행동 기술 기술에 집중하기 위한 새로운 텍스트 요약 기법.
- 복잡하고 도메인 특화되며 문장 부호가 부족한 CTI 텍스트를 보다 소비자 친화적인 형태로 정규화하기 위한 문법적 및 의미적 변환 기법.
- 문장 내 주어, 동사, 목적어 역할을 식별하기 위해 의미역할라벨링(SRL) 적용으로 '누가, 무엇을, 누구한테' 및 시간적/공간적 맥락을 유추할 수 있도록 하는 것.
- 노드가 시스템 엔티티(파일, 프로세스, 레지스트리 키, 소켓 등)를 나타내고 간선이 시스템 호출을 나타내며 인과적 및 시간적 의존 관계를 포함하는 유전적 그래프 구축.
- SRL 출력물을 공격 단계, 자산 및 정보 흐름을 모델링하는 그래프 데이터 구조에 통합하여 후속 분석에 활용.
- 실제 사고 보고서 및 DARPA 적대적 참여 보고서를 사용한 평가 파이프라인을 통해 그래프 정확성 및 위협 사냥에서의 유용성 검증.
실험 결과
연구 질문
- RQ1사전 정의된 템플릿이나 문법적 구조에 의존하지 않고도 비구조화된 CTI 보고서에서 정확하고 실행 가능한 공격 행동을 자동으로 추출할 수 있는가?
- RQ2텍스트 요약, 문법적 변환 및 SRL의 조합이 복잡한 CTI 보고서에서 시스템 엔티티와 동작 간의 인과적 및 시간적 관계를 얼마나 효과적으로 추출할 수 있는가?
- RQ3추출된 유전적 그래프가 구조적 및 완전성 측면에서 전문가가 구축한 그래프와 어느 정도 일치하는가?
- RQ4추출된 그래프가 위협 사냥 및 탐지 도구에서 효과적으로 활용될 수 있는가?
- RQ5언어적 복잡성과 전문 용어가 많은 다양한 CTI 보고서 출처에 대해 시스템의 확장성은 얼마나 우수한가?
주요 결과
- Extractor는 보안 전문가가 수작업으로 구성한 그래프와 유사한 높은 구조적 정밀도를 보이며 CTI 보고서에서 유전적 그래프를 성공적으로 추출했다.
- 지리적 기원이나 배경 정보와 같은 불필요한 내용을 필터링함으로써 공격 관련 텍스트를 정확하게 식별하는 데 높은 정밀도를 달성했다.
- SRL의 사용 덕분에 복잡하고 잘 구성되지 않은 보고서에서도 '누가, 무엇을, 누구한테' 및 행동의 시간 순서를 정확히 유추할 수 있었다.
- Extractor의 유전적 그래프는 감사 로그에 기록된 관찰 가능한 시스템 수준 행동을 모델링하므로 위협 사냥 및 탐지 도구에서 직접 사용 가능했다.
- 실제 사례 및 DARPA 적대적 참여 보고서에 대한 평가를 통해 다양한 플랫폼(Windows, Linux, FreeBSD) 및 보고서 유형에 걸쳐 시스템의 강건성을 확인했다.
- 대규모 CTI 보고서에 대해 효과적으로 확장 가능하여 공개된 자료에서 대량의 지식 추출을 자동화할 수 있었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.