Skip to main content
QUICK REVIEW

[논문 리뷰] The Rise of GoodFATR: A Novel Accuracy Comparison Methodology for Indicator Extraction Tools

Juan Antonio Caballero-Hernández, Gibran Gómez|arXiv (Cornell University)|2022. 07. 29.
Multi-Criteria Decision Making인용 수 5
한 줄 요약

이 논문은 수작업으로 레이블링된 기준 데이터가 필요 없이 지표 추출 도구의 정확도를 다수결 투표 방법을 사용해 비교하는 새로운 플랫폼인 GoodFATR를 소개한다. 6개의 소스에서 지속적으로 472,891건의 위협 보고서를 수집하고 978,151개의 지표를 추출함으로써 GoodFATR는 618,217개의 IOCs를 식별하며, 7개의 오픈소스 도구를 평가하여 다수결 투표 방식이 사이버 위협 지능 분야에서 신뢰할 수 있고 확장 가능한 정확도 비교를 가능하게 한다.

ABSTRACT

To adapt to a constantly evolving landscape of cyber threats, organizations actively need to collect Indicators of Compromise (IOCs), i.e., forensic artifacts that signal that a host or network might have been compromised. IOCs can be collected through open-source and commercial structured IOC feeds. But, they can also be extracted from a myriad of unstructured threat reports written in natural language and distributed using a wide array of sources such as blogs and social media. There exist multiple indicator extraction tools that can identify IOCs in natural language reports. But, it is hard to compare their accuracy due to the difficulty of building large ground truth datasets. This work presents a novel majority vote methodology for comparing the accuracy of indicator extraction tools, which does not require a manually-built ground truth. We implement our methodology into GoodFATR, an automated platform for collecting threat reports from a wealth of sources, extracting IOCs from the collected reports using multiple tools, and comparing their accuracy. GoodFATR supports 6 threat report sources: RSS, Twitter, Telegram, Malpedia, APTnotes, and ChainSmith. GoodFATR continuously monitors the sources, downloads new threat reports, extracts 41 indicator types from the collected reports, and filters non-malicious indicators to output the IOCs. We run GoodFATR over 15 months to collect 472,891 reports from the 6 sources; extract 978,151 indicators from the reports; and identify 618,217 IOCs. We analyze the collected data to identify the top IOC contributors and the IOC class distribution. We apply GoodFATR to compare the IOC extraction accuracy of 7 popular open-source tools with GoodFATR's own indicator extraction module.

연구 동기 및 목표

  • 사이버 위협 지능 분야에서 지표 추출 도구에 대한 신뢰할 수 있고 대규모 평가 방법의 부족을 해결하기 위해.
  • IOCs 추출 정확도를 평가하기 위해 대규모 기준 데이터셋을 구축하는 데 도전하는 데에.
  • RSS, 트위터, 테레그램 등의 다양한 소스에서 위협 보고서를 지속적이고 자동으로 수집할 수 있도록 하기 위해.
  • 여러 지표 추출 도구 간의 정확도를 도구 간 공감대를 기반으로 비교하는 방법론을 개발하기 위해.
  • 다양한 위협 보고서 소스 간에 상위 IOCs 기여자와 분포 패턴을 식별하기 위해.

제안 방법

  • GoodFATR는 RSS, 트위터, 텔레그램, 말페디아, APTnotes, 체인스미스의 6개 위협 보고서 소스를 지속적으로 모니터링한다.
  • SHA256 해시를 기반으로 보고서를 수집하고 중복 제거하며, 원본 추적 가능성을 유지한다.
  • iocsearcher 모듈을 통해 정규 표현식을 사용해 41종류의 지표 유형을 추출하고, 악성 지표가 아닌 항목을 걸러낸다.
  • 공감대를 정확도의 대체 기준으로 삼는 방식으로, 도구 간 공감대를 활용해 정확도 비교를 위한 새로운 다수결 투표 방법론을 적용한다.
  • URL 분석 및 재트윗 분석을 통해 새로운 고가치 소스를 식별함으로써 데이터 소스의 동적 확장을 가능하게 한다.
  • 보고서 버전 변경 여부를 감지하기 위해 ETag 및 HTTP HEAD 확인을 통해 증분 업데이트를 지원한다.

실험 결과

연구 질문

  • RQ1수작업으로 준비된 기준 데이터에 의존하지 않고 지표 추출 도구의 정확도를 어떻게 비교할 수 있는가?
  • RQ2어떤 위협 보고서 소스가 가장 많은 IOCs를 기여하고 있으며, 주로 어떤 유형의 IOCs가 많아지는가?
  • RQ3인기 있는 오픈소스 지표 추출 도구들이 다양한 IOCs 유형에서 정확도 측면에서 어떻게 비교되는가?
  • RQ4다양한 위협 보고서 소스와 시간에 따라 IOCs 유형의 분포는 어떻게 되는가?
  • RQ5여러 도구 간의 다수결 투표 방식이 IOCs 추출 평가에서 기준 데이터를 신뢰할 수 있게 근사할 수 있는가?

주요 결과

  • GoodFATR는 15개월 동안 6개의 소스에서 472,891건의 위협 보고서를 수집하고, 978,151개의 지표를 추출하며 618,217개의 IOCs를 식별했다.
  • 다수결 투표 방식이 수작업 레이블링이 필요 없이 7개의 오픈소스 지표 추출 도구를 비교 평가하는 데 성공적으로 기여했다.
  • 상위 IOCs 기여자는 말페디아와 APTnotes였으며, 도메인, IP 주소, 파일 해시와 관련된 높은 수의 IOCs를 기여했다.
  • IOCs 유형의 분포는 소스 간에 상당한 차이를 보였으며, 소셜 미디어와 블로그는 블록체인 주소, 소셜 계정명 등 더 다양한 유형을 기여했다.
  • GoodFATR의 iocsearcher 모듈은 뛰어난 성능을 보이며 비교를 위한 신뢰할 수 있는 기준이 되었다.
  • 플랫폼의 동적 소스 탐지 메커니즘이 URL 분석 및 재트윗 분석을 통해 새로운 고가치 소스를 성공적으로 식별했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.