Skip to main content
QUICK REVIEW

[논문 리뷰] STIXnet: A Novel and Modular Solution for Extracting All STIX Objects in CTI Reports

Francesco Marchiori, Mauro Conti|arXiv (Cornell University)|2023. 03. 17.
Software Engineering Research인용 수 4
한 줄 요약

STIXnet는 비구조화된 사이버 위협 지능(CTI) 보고서에서 모든 구조화된 위협 정보 표현(STIX) 엔터티와 관계를 자동으로 추출하기 위한 새로운 모듈식 프레임워크이다. 자연어 처리(NLP), 규칙 기반 방법 및 동적 지식 기반(KB)을 조합하여, 모든 STIX 표준 객체 유형과 관계를 스케일러블하고 확장 가능한 파이프라인으로 지원하면서도 최신 기술 수준(F1 점수 0.916, 엔터티 추출)과 F1 점수 0.724(관계 추출)를 달성한다.

ABSTRACT

The automatic extraction of information from Cyber Threat Intelligence (CTI) reports is crucial in risk management. The increased frequency of the publications of these reports has led researchers to develop new systems for automatically recovering different types of entities and relations from textual data. Most state-of-the-art models leverage Natural Language Processing (NLP) techniques, which perform greatly in extracting a few types of entities at a time but cannot detect heterogeneous data or their relations. Furthermore, several paradigms, such as STIX, have become de facto standards in the CTI community and dictate a formal categorization of different entities and relations to enable organizations to share data consistently. This paper presents STIXnet, the first solution for the automated extraction of all STIX entities and relationships in CTI reports. Through the use of NLP techniques and an interactive Knowledge Base (KB) of entities, our approach obtains F1 scores comparable to state-of-the-art models for entity extraction (0.916) and relation extraction (0.724) while considering significantly more types of entities and relations. Moreover, STIXnet constitutes a modular and extensible framework that manages and coordinates different modules to merge their contributions uniquely and exhaustively. With our approach, researchers and organizations can extend their Information Extraction (IE) capabilities by integrating the efforts of several techniques without needing to develop new tools from scratch.

연구 동기 및 목표

  • 점점 증가하는 CTI 보고서에서 이질적인 사이버 위협 지능을 수동으로 추출하는 데 발생하는 도전 과제를 해결하기 위해.
  • 기존의 자연어 처리(NLP) 모델이 STIX 엔터티와 관계의 일부만 추출하고, 상호운용성도 열악한 점을 극복하기 위해.
  • 모든 엔터티 및 관계 유형에서 STIX 표준에 완전히 준수하는 모듈식이고 확장 가능한 프레임워크를 개발하기 위해.
  • 오류 전파를 줄이기 위해 잘못 분류된 엔터티를 독립적으로 평가하고 선택적으로 필터링할 수 있도록 하기 위해.
  • 위협 분석가가 지능을 지식 그래프 형태로 시각화하고 탐색할 수 있도록 스케일러블하고 상호작용 가능한 시스템을 제공하기 위해.

제안 방법

  • 엔터티 추출, 관계 추출, 지식 기반 통합을 별개의 조합 가능한 구성 요소로 분리한 모듈식 파이프라인 아키텍처를 사용한다.
  • 엔터티 추출은 사전 학습된 NLP 모델(spaCy, BERT 기반 모델 등)과 규칙 기반 정규 표현식, 그리고 엔터티 정규화 및 의미 해소를 위한 동적 지식 기반(KB)을 결합한다.
  • 관계 추출은 하이브리드 접근 방식을 사용한다: 문장 임bedding 기반 딥러닝 모델과 규칙 기반 시스템을 조합하며, 신뢰도 점수는 [0,1] 범위로 정규화되어 임계값(0.5) 적용 가능하다.
  • 낮은 신뢰도 관계를 필터링하기 위해 0.5의 신뢰도 임계값을 적용하여 가짜 양성(false positive)을 줄이고 재현율(recall)을 유지한다.
  • 결과를 지식 그래프 형태로 시각화하기 위한 그래픽 인터페이스를 사용하며, 노드는 STIX 객체를, 간선은 관계를 나타내며, KB에서 제공하는 확장된 메타데이터를 포함한다.
  • 지식 기반은 각 보고서 처리 시점마다 점진적으로 풍부해지며, 지속적인 학습과 시간이 지남에 따라 모델의 일반화 능력 향상에 기여한다.

실험 결과

연구 질문

  • RQ1모듈식이고 확장 가능한 프레임워크가 비구조화된 CTI 보고서에서 모든 STIX 표준 엔터티와 관계를 고성능으로 추출할 수 있는가?
  • RQ2자연어 처리, 규칙 기반 논리 및 동적 지식 기반의 통합이 단일 모델 대비 추출 정확도와 커버리지 향상에 어떤 영향을 미치는가?
  • RQ3엔터티 추출에서 유도된 오류 전파가 관계 추출 성능에 미치는 영향은 어느 정도이며, 이를 완화할 수 있는가?
  • RQ4딥러닝과 규칙 기반 시스템을 융합한 하이브리드 환경에서 정밀도와 재현율을 균형 잡는 데 최적의 신뢰도 임계값은 무엇인가?
  • RQ5이 프레임워크는 변화하는 위협 지능 요구사항을 충족하기 위해 실시간 업데이트 및 확장성을 지원할 수 있는가?

주요 결과

  • STIXnet는 엔터티 추출에서 F1 점수 0.916를 기록하였으며, 더 넓은 STIX 객체 유형 범위를 지원함에도 불구하고 최신 기술 수준의 모델과 동일한 성능을 달성한다.
  • 관계 추출 모듈은 F1 점수 0.724를 기록하여 CTI 보고서의 복잡하고 이질적인 관계에 대해 뛰어난 성능을 보였다.
  • 잘못 분류된 엔터티를 제외함으로써 오류 전파를 완화한 결과, 정밀도는 0.721에서 0.828로 향상되었지만, 참 양성 수가 감소하여 재현율은 감소하였다.
  • 관계 추출에 최적의 신뢰도 임계값은 0.5로, 가짜 양성과 가짜 음성 간 균형을 잘 잡는 데 기여하였다.
  • 모듈식 아키텍처 덕분에 새로운 추출 모듈을 즉시 통합할 수 있어 특정 위협 지능 사용 사례에 맞게 맞춤화할 수 있다.
  • 동적 지식 기반은 지속적인 풍부화를 가능하게 하며, 매번 새로운 보고서를 처리할 수록 장기적인 시스템 성능 향상에 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.