Skip to main content
QUICK REVIEW

[논문 리뷰] What are the attackers doing now? Automating cyber threat intelligence extraction from text on pace with the changing threat landscape: A survey

Md Rayhanur Rahman, Rezvan Mahdavi-Hezaveh|arXiv (Cornell University)|2021. 09. 14.
Cybercrime and Law Enforcement Studies참고 문헌 91인용 수 7
한 줄 요약

이 종합 검토는 자연어 처리(NLP)와 기계 학습을 활용하여 비구조화된 텍스트에서 사이버 위협 지능(CTI) 추출을 자동화하기 위한 체계적 프레임워크를 제안한다. 이는 10개의 CTI 추출 목적과 7개의 주요 데이터 소스—특히 위협 보고서, 해커 포럼, 소셜 미디어—를 식별한다. 연구는 감독 학습 및 비감독 학습 기반의 NLP 기법을 核심 방법으로 간주하며, 데이터 품질과 재현 가능성의 과제를 강조하고, 실질적이고 확장 가능하며 우선순위가 부여된 CTI 파이프라인을 통해 사전 방어를 지원할 것을 주장한다.

ABSTRACT

Cybersecurity researchers have contributed to the automated extraction of CTI from textual sources, such as threat reports and online articles, where cyberattack strategies, procedures, and tools are described. The goal of this article is to aid cybersecurity researchers understand the current techniques used for cyberthreat intelligence extraction from text through a survey of relevant studies in the literature. We systematically collect "CTI extraction from text"-related studies from the literature and categorize the CTI extraction purposes. We propose a CTI extraction pipeline abstracted from these studies. We identify the data sources, techniques, and CTI sharing formats utilized in the context of the proposed pipeline. Our work finds ten types of extraction purposes, such as extraction indicators of compromise extraction, TTPs (tactics, techniques, procedures of attack), and cybersecurity keywords. We also identify seven types of textual sources for CTI extraction, and textual data obtained from hacker forums, threat reports, social media posts, and online news articles have been used by almost 90% of the studies. Natural language processing along with both supervised and unsupervised machine learning techniques such as named entity recognition, topic modelling, dependency parsing, supervised classification, and clustering are used for CTI extraction. We observe the technical challenges associated with these studies related to obtaining available clean, labelled data which could assure replication, validation, and further extension of the studies. As we find the studies focusing on CTI information extraction from text, we advocate for building upon the current CTI extraction work to help cybersecurity practitioners with proactive decision making such as threat prioritization, automated threat modelling to utilize knowledge from past cybersecurity incidents.

연구 동기 및 목표

  • 비구조화된 텍스트 자료에서 자동으로 사이버 위협 지능(CTI) 추출에 관한 기존 연구를 체계화하고 분류하기 위해.
  • CTI 추출 연구에서 사용되는 주요 목적, 데이터 소스, 기법, 공유 형식을 규명하기 위해.
  • 재현 가능하고 확장 가능한 위협 지능 연구를 지원하는 일반화된 CTI 추출 파이프라인을 제안하기 위해.
  • 청결하고 레이블이 부여된 데이터 부족 및 연구 간 모델의 일반화 능력 부족 등의 기술적 과제를 해결하기 위해.
  • 실세계 사이버 방어 응용을 위해 실질적이고 우선순위가 부여되며 상관관계가 있는 CTI를 제공할 수 있도록 향후 연구를 이끌기 위해.

제안 방법

  • 6개의 학술 데이터베이스를 대상으로 체계적 문헌 검토를 수행하여 텍스트에서 CTI 추출에 관한 64개의 연구를 확보하였다.
  • 오픈 코딩과 카드 정렬 기법을 적용하여 연구를 정성적으로 분석하고 CTI 추출 목적 및 기법을 분류하였다.
  • 합성된 연구들로부터 추출한 표준화된 CTI 추출 파이프라인을 제안하였으며, 데이터 수신, NLP 처리, CTI 정형화 단계를 포함한다.
  • 10개의 고유한 CTI 추출 목적(예: IoC 추출, TTPs, 공격 패턴 추출)과 7개의 텍스트 데이터 소스(예: 위협 보고서, 소셜 미디어, 다크 웹 포럼)를 매핑하였다.
  • 핵심 NLP 및 기계 학습 기법으로서 명명된 실체 인식(ner), 토픽 모델링, 의존성 파싱, 감독 분류, 군집화, 단어 임베딩를 식별하였다.
  • 출판된 연구에서 코드와 데이터 가용성을 평가하여 재현 가능성과 연구 지속 가능성을 점검하였다.

실험 결과

연구 질문

  • RQ1현재 연구에서 비구조화된 텍스트 자료에서 사이버 위협 지능 추출의 주요 목적은 무엇인가요?
  • RQ2CTI 추출에 가장 자주 사용되는 텍스트 데이터 소스는 무엇이며, 기능성과 신뢰성 측면에서 어떻게 다릅니까?
  • RQ3CTI 추출에 주로 사용되는 NLP 및 기계 학습 기법은 무엇이며, 성능과 적용 측면에서 어떻게 비교될 수 있나요?
  • RQ4CTI 추출 연구의 재현 가능성과 확장 가능성을 저해하는 기술적 과제는 무엇인가요?
  • RQ5향후 CTI 추출 시스템은 어떻게 설계되어야 실시간 방어에 실질적이고 우선순위가 부여되며 상관관계가 있는 위협 지능을 제공할 수 있나요?

주요 결과

  • 이 연구는 10개의 고유한 CTI 추출 목적을 규명하였으며, 특히 CTI 텍스트 분류, 공격 패턴 추출, 사이버 보안 키워드 추출이 연구 집중도가 가장 높았다.
  • 해커 포럼, 위협 보고서, 소셜 미디어 게시물, 온라인 뉴스 기사가 전체 64개의 연구에서 사용된 텍스트 데이터 소스의 약 90%를 차지하였다.
  • 감독 학습 및 비감독 학습 기반의 NLP 기법—특히 명명된 실체 인식, 토픽 모델링, 의존성 파싱—이 CTI 추출에 가장 널리 사용된 방법이었다.
  • 연구의 소수에 불과한 연구들(예: Niakanlahiji 등과 Samtani 등)만이 GitHub에 코드와 레이블이 부여된 데이터셋을 공개하여 재현성의 심각한 격차를 드러냈다.
  • 대부분의 연구가 단일 데이터셋에 집중함으로써 상호 연구 간 상관관계 및 확장 가능성에 제약이 있었으며, 이는 통합된 다중 소스 CTI 통합의 필요성을 강조하였다.
  • 향후 연구는 실질적 CTI, 변화하는 공격 전략에 대한 적응성, 그리고 추출 정확도 향상을 위해 도메인 특화 언어 모델(예: sec2vec) 개발을 우선순위로 삼아야 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.