[論文レビュー] Grouping the executables to detect malware with high accuracy
本稿では、実行可能ファイルのサイズに基づくクラスタリングを用いて、マルウェアをファミリーにグループ化する高精度なマルウェア検出手法を提案する。3つの変形マルウェアキット(G2、PS-MPC、NGVCK)のファイルサイズに最適なk-Meansクラスタリングを適用することで、安定したサイズ分布を特定し、選択された特徴量に基づいて分類器(Random Forest、J48、LMT、FT、NBT)を学習させることで、最大99.11%の検出精度を達成した。
The metamorphic malware variants with the same malicious behavior (family), can obfuscate themselves to look different from each other. This variation in structure leads to a huge signature database for traditional signature matching techniques to detect them. In order to effective and efficient detection of malware in large amounts of executables, we need to partition these files into groups which can identify their respective families. In addition, the grouping criteria should be chosen such a way that, it can also be applied to unknown files encounter on computers for classification. This paper discusses the study of malware and benign executables in groups to detect unknown malware with high accuracy. We studied sizes of malware generated by three popular second generation malware (metamorphic malware) creator kits viz. G2, PS-MPC and NGVCK, and observed that the size variation in any two generated malware from same kit is not much. Hence, we grouped the executables on the basis of malware sizes by using Optimal k-Means Clustering algorithm and used these obtained groups to select promising features for training (Random forest, J48, LMT, FT and NBT) classifiers to detect variants of malware or unknown malware. We find that detection of malware on the basis of their respected file sizes gives accuracy up to 99.11% from the classifiers.
研究の動機と目的
- 構造的スプライシングによって従来の署名ベース手法が回避される変形マルウェアの変種を検出する課題に対処すること。
- 内在的特徴に基づいてマルウェアをファミリーにグループ化することで、常に増大し続ける大規模な署名データベースの必要性を低減すること。
- ファイルサイズを安定したクラスタリング基準として活用することで、未知のファイルに対してもスケーラブルで効率的な手法を構築すること。
- サイズベースのクラスタリングと選択された特徴量に対する教師あり学習を組み合わせることで、未知マルウェアの検出精度を向上させること。
提案手法
- 第二世代マルウェアキット(G2、PS-MPC、NGVCK)から生成されたマルウェアのファイルサイズ分布を分析する。
- 同じマルウェアファミリー内でのサイズ変動が小さいことに着目し、実行可能ファイルをファイルサイズに基づいてクラスタリングするため、最適なk-Meansクラスタリングアルゴリズムを適用する。
- クラスタリングされたグループから有望な特徴量を選択し、複数の分類器(Random Forest、J48、LMT、FT、NBT)を学習させる。
- グループ化および特徴量選択が行われたデータセット上で各分類器の性能を評価し、検出精度を測定する。
- コード構造が変化しても一貫したパターンを特定できるように、クラスタリング結果を基盤として利用する。
実験結果
リサーチクエスチョン
- RQ1コードのスプライシングがあっても、ファイルサイズは変形マルウェアをファミリーにグループ化するための信頼性があり安定した特徴量として機能するか?
- RQ2実行可能ファイルをファイルサイズでクラスタリングすることで、未知のマルウェア変種の検出精度が向上するか?
- RQ3サイズベースのクラスタから選択された特徴量で学習された標準的な機械学習分類器の有効性はどの程度か?
- RQ4サイズベースのグループ化によって、マルウェア検出における大規模な署名データベースの必要性はどの程度低減されるか?
主な発見
- G2、PS-MPC、NGVCKの同じキットから生成されたマルウェアのファイルサイズ分布には最小限の変動があり、サイズが安定したクラスタリング特徴量であることが示された。
- 最適なk-Meansクラスタリングアルゴリズムにより、サイズに基づいて一貫性のあるファミリーに実行可能ファイルが適切にグループ化され、一貫した特徴量選択が可能になった。
- サイズベースのクラスタから得た特徴量で学習された分類器は、検出性能が顕著に向上した。
- Random Forest分類器が、未知のマルウェア変種に対して99.11%の最高検出精度を達成した。
- 本手法は、署名データベースに依存せずに、未知マルウェア検出に対して高いスケーラビリティと有効性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。