Skip to main content
QUICK REVIEW

[論文レビュー] EXTRACTOR: Extracting Attack Behavior from Threat Reports

Kiavash Satvat, Rigel Gjomemo|arXiv (Cornell University)|Apr 17, 2021
Advanced Malware Detection Techniques参考文献 55被引用数 7
ひとこと要約

Extractorは、システムレベルの行動、エンティティ、因果的依存関係を表すプロヴァンスグラフを構築することで、非構造的なサイバーセキュリティ脅威インテリジェンス(CTI)レポートから要約され、実行可能である攻撃行動を自動で抽出する、新しいNLPベースのツールである。文書の冗長性、テキストの複雑さ、関係抽出の課題を克服するため、テキスト要約、句構造変換、意味的役割ラベル付け(SRL)を組み合わせたパイプラインを採用し、エキスパートがアノテートしたレポートと照合して検証された高精度なグラフ抽出を達成し、脅威ハンティングワークフローへの直接的利用を可能にした。

ABSTRACT

The knowledge on attacks contained in Cyber Threat Intelligence (CTI) reports is very important to effectively identify and quickly respond to cyber threats. However, this knowledge is often embedded in large amounts of text, and therefore difficult to use effectively. To address this challenge, we propose a novel approach and tool called EXTRACTOR that allows precise automatic extraction of concise attack behaviors from CTI reports. EXTRACTOR makes no strong assumptions about the text and is capable of extracting attack behaviors as provenance graphs from unstructured text. We evaluate EXTRACTOR using real-world incident reports from various sources as well as reports of DARPA adversarial engagements that involve several attack campaigns on various OS platforms of Windows, Linux, and FreeBSD. Our evaluation results show that EXTRACTOR can extract concise provenance graphs from CTI reports and show that these graphs can successfully be used by cyber-analytics tools in threat-hunting.

研究の動機と目的

  • 冗長で非構造的なCTIレポートから包括的かつ構造化された攻撃行動を抽出する課題に対処すること。
  • 因果的・時系列的・情報フロー関係を捉えていない、個別のIOCsや脅威行動に限定された先行研究の限界を克服すること。
  • 脅威検出やアナリティクスに直接利用可能な、機械可読で実行可能なインテリジェンスを、プロヴァンスグラフの形で生成すること。
  • 実世界およびDARPAの敵対的参加レポートを含む、多様なソースからの大規模なCTIレポート、ブログ、インシデントレポートの処理をスケーラブルにすること。
  • 自然言語における「だれが何を、だれに対して、いつ、どこで」を反映する、自動的で正確かつ意味的に豊富な攻撃行動抽出を実現すること。

提案手法

  • 攻撃関連のコンテンツを無関係なテキストから分離する、新しいテキスト要約技術を用いて冗長性を低減し、行動記述に焦点を当てる。
  • 複雑でドメイン特有で、句読点が不十分なCTIテキストを、より扱いやすい形に正規化するための句構造的・意味的変換技術。
  • 文における主語・動詞・目的語の役割を特定する意味的役割ラベル付け(SRL)の適用により、「だれが何を、だれに対して」を推論し、時系列的・空間的文脈を抽出する。
  • ノードがシステムエンティティ(ファイル、プロセス、レジストリーキー、ソケット)を表し、エッジがシステムコールを表す行動と因果的・時系列的依存関係を持つプロヴァンスグラフの構築。
  • SRLの出力をグラフデータ構造に統合し、攻撃ステップ、アーティファクト、情報フローをモデル化し、後続のアナリティクスに活用する。
  • 実世界のインシデントレポートおよびDARPAの敵対的参加レポートを用いた評価パイプラインにより、グラフの正確性と脅威ハンティングにおける実用性を検証する。

実験結果

リサーチクエスチョン

  • RQ1事前に定義されたテンプレートや文法構造に依存せずに、非構造的なCTIレポートから正確で実行可能な攻撃行動を自動で抽出できるか?
  • RQ2テキスト要約、句構造変換、SRLの組み合わせにより、複雑なCTIレポートにおけるシステムエンティティおよび行動間の因果的・時系列的関係をどの程度効果的に抽出できるか?
  • RQ3抽出されたプロヴァンスグラフが、構造的・完全性の観点からエキスパートが作成したグラフとどの程度一致するか?
  • RQ4抽出されたグラフが、脅威ハンティングおよび検出のためのサイバアナリティクスツールによって効果的に利用できるか?
  • RQ5高レベルの言語的複雑さや技術用語を含む多様なCTIレポートソースにおいて、このシステムはどの程度スケーラブルに動作するか?

主な発見

  • Extractorは、セキュリティエキスパートが手作業で作成したグラフと類似した構造のプロヴァンスグラフをCTIレポートから効果的に抽出し、高い構造的整合性を示した。
  • 地理的出どころや背景情報などの無関係なコンテンツをフィルタリングすることで、攻撃関連テキストの特定において高い正確性を達成した。
  • SRLの活用により、複雑で構造が不十分なレポートでさえ、「だれが何を、だれに対して」を正確に推論し、行動の時系列順序を特定できた。
  • Extractorが生成するプロヴァンスグラフは、監査ログに記録された観察可能なシステムレベルの行動をモデル化しているため、脅威ハンティングおよび検出ツールに直接利用可能である。
  • 実世界およびDARPAの敵対的参加レポートを用いた評価により、Windows、Linux、FreeBSDを含む多様なプラットフォームおよびレポートタイプにおいて、システムの頑健性が確認された。
  • このアプローチは、大規模なCTIレポートの処理に効果的にスケーリングでき、公開可能なソースから大規模に自動的に知識抽出を実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。