[論文レビュー] Robust and Effective Malware Detection through Quantitative Data Flow Graph Metrics
本稿では、リsources間の測定可能なデータフローを通じてシステム動作をモデル化する定量的データフロー・グラフ(QDFG)を用いた、耐障害性の高いマルウェア検出手法を提案する。社会的ネットワーク解析にインspされたグラフ指標を適用し、これらの特徴量を学習用に機械学習分類器に供給することで、98.01%の検出率と0.48%の偽陽性率を達成した。これは、コール再順序化や不正なシステムコール挿入といった代表的な動作の隠蔽技術に対しても、n-gram法や生のシステムコールベース手法と比較して優れた耐性を示した。
We present a novel malware detection approach based on metrics over quantitative data flow graphs. Quantitative data flow graphs (QDFGs) model process behavior by interpreting issued system calls as aggregations of quantifiable data flows.Due to the high abstraction level we consider QDFG metric based detection more robust against typical behavior obfuscation like bogus call injection or call reordering than other common behavioral models that base on raw system calls. We support this claim with experiments on obfuscated malware logs and demonstrate the superior obfuscation robustness in comparison to detection using n-grams. Our evaluations on a large and diverse data set consisting of about 7000 malware and 500 goodware samples show an average detection rate of 98.01% and a false positive rate of 0.48%. Moreover, we show that our approach is able to detect new malware (i.e. samples from malware families not included in the training set) and that the consideration of quantities in itself significantly improves detection precision.
研究の動機と目的
- 従来の署名ベースおよび動作ベースの検出手法を回避する、隠蔽されたマルウェアを検出する課題に対処すること。
- コール再順序化や偽のシステムコール挿入といった一般的な隠蔽技術に対する検出の耐性を向上させること。
- グラフベースの動作モデルに定量的データフロー情報を組み込むことで、検出の正確性を向上させること。
- 柔軟な指標ベースのプロファイリングにより、未知のマルウェアファミリー(ゼロデイ検出)を検出可能にする。
- 部分グラフ同型判定やトレース追跡手法に対するスケーラブルで効率的な代替手法を開発すること。
提案手法
- システムコールをプロセス、ファイル、ソケットなどのエンティティ間の定量的データフローとして解釈することで、システム動作を定量的データフロー・グラフ(QDFG)でモデル化する。
- 時間間隔ごとにシステムコールイベントを集約し、データ転送をラベル付き有向エッジとして表現。ノードおよびエッジ属性としてデータ量と種別を設定する。
- プロセスノードに対して、次数中心性、媒介性、固有ベクトル中心性といったグラフ指標を計算し、行動プロファイルを抽出する。
- これらの指標を、ラベル付きの健全(goodware)および悪意ある(マルウェア)プロセスサンプルで学習した機械学習分類器の入力特徴量として使用する。
- 正確なパターンマッチングではなく、指標ベースのプロファイリングによる近似類似性比較を適用することで、動作の隠蔽に対する耐性を向上させる。
- QDFGの高レベルの抽象化を活用し、事前にその動作を把握していなくても、未知のマルウェアファミリーを検出可能にする。
実験結果
リサーチクエスチョン
- RQ1生のシステムコールシーケンスと比較して、定量的データフロー・グラフ指標を用いることで、検出精度および動作の隠蔽に対する耐性が向上するか。
- RQ2QDFGベースの指標は、学習データに存在しないファミリーに属する以前に未発見のマルウェアサンプルをどの程度検出できるか。
- RQ3グラフモデリングにデータ量(例:転送バイト数)を組み込むことで、偽陽性率および偽陰性率にどのような影響を与えるか。
- RQ4本手法は、n-gramベースおよび部分グラフ同型判定ベースの検出手法と比較して、耐性および効率性において優れているか。
- RQ5指標ベースのQDFG解析は、従来のグラフベースのマルウェア検出手法と比較して、検出効果性および隠蔽に対する耐性において優れているか。
主な発見
- 提案手法のQDFGベースのアプローチは、約7,000件のマルウェアおよび500件の健全ソフトウェアサンプルから成るデータセットで、平均98.01%の検出率と0.48%の偽陽性率を達成した。
- モデルに定量的データフロー要因を組み込むことで、非定量的アプローチと比較して偽陽性率および偽陰性率の両方が約半減した。
- データフロー量の抽象化により、コール再順序化や偽のシステムコール挿入といった一般的な隠蔽技術に対して優れた耐性を示した。
- 以前に未発見のファミリーに属するマルウェアサンプルを効果的に検出できたことから、既知のマルウェアパターンを超えた良好な一般化能力を示した。
- n-gramベースの検出手法と比較して、本手法は隠蔽に対する耐性が優れており、n-gramはコールシーケンスの変化に敏感であるため。
- 正確な部分グラフマッチングではなくグラフ指標を用いることで、高価な同型判定チェックに依存せず、効率的かつスケーラブルな検出が可能になった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。