Skip to main content
QUICK REVIEW

[論文レビュー] Novel Feature Extraction, Selection and Fusion for Effective Malware Family Classification

Mansour Ahmadi, Dmitry Ulyanov|arXiv (Cornell University)|Nov 13, 2015
Advanced Malware Detection Techniques参考文献 28被引用数 4
ひとこと要約

本論文は、マルウェアをアンパックまたはデオブスファイアする必要なく、ポータブル実行可能(PE)ファイルから新しい構造的特徴を抽出する軽量で高精度なマルウェアファミリ分類システムを提案する。コンテンツベースの特徴と統計的特徴を、クラスごとの重み付け戦略とXGBoostによるバギングを用いて統合することで、Microsoft Malware Classification Challengeデータセットで99.8%の精度を達成し、計算コストが著しく低い複雑なモデルを上回る性能を発揮した。

ABSTRACT

Modern malware is designed with mutation characteristics, namely polymorphism and metamorphism, which causes an enormous growth in the number of variants of malware samples. Categorization of malware samples on the basis of their behaviors is essential for the computer security community, because they receive huge number of malware everyday, and the signature extraction process is usually based on malicious parts characterizing malware families. Microsoft released a malware classification challenge in 2015 with a huge dataset of near 0.5 terabytes of data, containing more than 20K malware samples. The analysis of this dataset inspired the development of a novel paradigm that is effective in categorizing malware variants into their actual family groups. This paradigm is presented and discussed in the present paper, where emphasis has been given to the phases related to the extraction, and selection of a set of novel features for the effective representation of malware samples. Features can be grouped according to different characteristics of malware behavior, and their fusion is performed according to a per-class weighting paradigm. The proposed method achieved a very high accuracy ($\approx$ 0.998) on the Microsoft Malware Challenge dataset.

研究の動機と目的

  • アンパックやデオブスファイアを伴わずに、多様化・変種化するマルウェア(ポリモーフィック・メタモーフィック)の変種を効率的に分類する課題に対処すること。
  • 分類性能を向上させるために、PEファイルの内在的特徴を捉える、コンactな構造的特徴のセットを設計すること。
  • 産業的導入に適した低計算コストを実現しながら、高い分類精度を達成すること。
  • 複雑なモデルに比べて特徴量の数を削減することで、解釈可能性の高いマルウェア分類を実現すること。
  • 実際のアンチマルウェア環境におけるシステムの耐性および実用性を評価すること。

提案手法

  • マルウェアサンプルからバイトコードn-gram、オペレーションコードn-gram、APIコールシーケンスといったコンテンツベースの特徴を抽出する。
  • セクションおよびヘッダのエントロピーと分布パターンを反映する、PEファイルの構造的レイアウトを示す新規な統計的特徴を提案する。
  • 精度と特徴量数のバランスを取るために、前向きステップワイズ特徴選択アルゴリズムを適用し、最も関連性の高い特徴カテゴリを同定する。
  • ファミリ固有の判別信号を強調するために、クラスごとの重み付けを用いた特徴統合を実施する。
  • 効率性と耐性を重視し、複雑なアンサンブルアーキテクチャを避けるために、XGBoostにバギングを組み合わせた分類器を採用する。
  • 生バイナリおよびデアセンブリドコードの静的解析に依存することで、アンパックおよびデオブスファイアを回避する。

実験結果

リサーチクエスチョン

  • RQ1PEファイルの新規構造的特徴は、アンパックやデオブスファイアを要せず、マルウェアファミリ分類の精度を向上させることができるか?
  • RQ2コンテンツベースと構造的特徴の異なるタイプの統合は、分類性能にどのように影響するか?
  • RQ3マルウェアファミリ分類において、特徴量のサイズと分類精度のトレードオフはどのようなものか?
  • RQ4特にMicrosoft Malware Challengeの優勝ソリューションと比較して、本手法は性能と複雑性の面でどのように差をつけるか?
  • RQ5分類を目的とした本手法は、攻撃への耐性やポisons攻撃に対してどれほど耐性を示すか、設計の観点から検証できるか?

主な発見

  • 提案手法は、Microsoft Malware Classification Challengeデータセットで約0.998の分類精度を達成し、優勝チームの0.9983と同等の結果を出した。
  • テストデータにおいてロスロス(logloss)が0.0028に留まり、モデルの一般化性能およびキャリブレーションの高さが示された。
  • 優勝ソリューションがリソース集約的なn-gram特徴と複雑なアンサンブルを採用していたのに対し、本手法は著しく低い計算コストを実現した。
  • 新規構造的特徴の活用により、アンパックを伴わず、パッケージドやオブスファイドされたマルウェアの効果的な分類が可能となり、性能が維持された。
  • 前向き特徴選択プロセスにより、特徴量の数を効果的に削減しながらも高い精度を維持でき、解釈可能性が向上した。
  • 高い精度と低い計算コストのバランスを考慮し、産業的導入に適したシステムであることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。