Skip to main content
QUICK REVIEW

[論文レビュー] Adaptive and Scalable Android Malware Detection through Online Learning

A. Sankara Narayanan, Yang Liu|arXiv (Cornell University)|Jun 23, 2016
Advanced Malware Detection Techniques参考文献 13被引用数 17
ひとこと要約

本論文では、インタープロシージャル・コントロールフローグラフ(ICFG)特徴量とパassive-aggressive分類器を用いて継続的なモデル更新を行うことで、進化するマルウェアに適応するオンライン学習ベースのAndroidマルウェア検出フレームワーク、DroidOLを提案する。通常の設定下で、最先端のバッチ手法を20%以上上回る84.29%の精度を達成し、マルウェア集団のドリフトやスケーラビリティに対しても優れた適応性を示している。

ABSTRACT

It is well-known that malware constantly evolves so as to evade detection and this causes the entire malware population to be non-stationary. Contrary to this fact, prior works on machine learning based Android malware detection have assumed that the distribution of the observed malware characteristics (i.e., features) do not change over time. In this work, we address the problem of malware population drift and propose a novel online machine learning based framework, named DroidOL to handle it and effectively detect malware. In order to perform accurate detection, security-sensitive behaviors are captured from apps in the form of inter-procedural control-flow sub-graph features using a state-of-the-art graph kernel. In order to perform scalable detection and to adapt to the drift and evolution in malware population, an online passive-aggressive classifier is used. In a large-scale comparative analysis with more than 87,000 apps, DroidOL achieves 84.29% accuracy outperforming two state-of-the-art malware techniques by more than 20% in their typical batch learning setting and more than 3% when they are continuously re-trained. Our experimental findings strongly indicate that online learning based approaches are highly suitable for real-world malware detection.

研究の動機と目的

  • 進化するマルウェアの特性によって静的バッチ学習モデルが無効化されるマルウェア集団のドリフト問題に対処すること。
  • 大量のデータと頻繁な再訓練を要する大規模なAndroidマルウェア検出において、バッチ学習のスケーラビリティ制限を克服すること。
  • 新しいサンプルを継続的にモデル更新することで、高い検出精度を維持するリアルタイムで適応可能な検出システムを開発すること。
  • オンライン学習が、動的環境における実用的で大規模なマルウェア検出において、バッチ学習よりも効果的であることを実証すること。

提案手法

  • アプリの行動的意味を捉えるために、インタープロシージャル・コントロールフローサブグラフ(ICFG)を用いてセキュリティ感受性特徴量を抽出する。
  • Weisfeiler-Lehman(WL)グラフカーネルを適用し、ICFGを機械学習に適した高次元の特徴ベクトルに変換する。
  • 各新しいラベル付きサンプルに対して逐次更新を行うオンラインのパssive-aggressive分類器を採用し、特徴のドリフトに継続的に適応する。
  • すべての履歴データを逐次処理することで、過去のマルウェアパターンの長期記憶を維持し、実質的に無限大のバッチサイズを再現する。
  • モデルパラメータを各新しいアプリの解析後に更新するストリーミングでインクリメンタルな学習アプローチを採用し、低遅延検出を実現する。
  • 87,000以上のアプリからなる実世界のデータセットを用いて、2つの最先端のバッチ学習手法と性能を比較評価する。

実験結果

リサーチクエスチョン

  • RQ1オンライン学習は、進化するAndroidマルウェア集団の非ステーションナリティ(非定常性)を効果的に扱えるか?
  • RQ2時間経過に伴う精度と適応性の観点から、オンライン学習とバッチ学習の性能はどのように比較されるか?
  • RQ3高速な再訓練と長期記憶の効果が、多様化するマルウェアや長期間にわたるマルウェアファミリーに対して、検出精度にどの程度影響を与えるか?
  • RQ4ICFGからのグラフカーネルベースの構造的特徴量は、マルウェアにおけるオブスカリティや回避攻撃に対して、より高い耐性を発揮するか?

主な発見

  • DroidOLは、87,000以上のAndroidアプリからなる実世界のデータセットで84.29%の検出精度を達成し、標準的なバッチ学習設定下で2つの最先端バッチ学習手法を20%以上も上回った。
  • 毎日再訓練を行うことで、バッチ学習ベースラインの性能は向上するが、DroidOLの性能には届かず、継続的な再訓練下でも3%以上上回った。
  • Drebin 5Kデータセットの約80%のマルウェアサンプルが最小バージョン遅延が0日であることが判明し、急速な多様化(ポリモーマル)なリリースパターンが顕在しており、1日または継続的なモデル更新が不可欠であることを示している。
  • 40%を超えるマルウェアファミリーが最大バージョン遅延が1年以上に達しており、進化する行動を捉えるために長期記憶が検出モデルに不可欠であることを示している。
  • オンライン学習は、本質的に長期記憶と継続的適応をサポートしており、大規模バッチ再訓練の計算的負荷なしに効果的な検出を可能にする。
  • 結果から、オンライン学習は、その適応性とスケーラビリティのおかげで、大規模かつ現実世界のAndroidマルウェア検出にバッチ学習を上回る適性を持つことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。