Skip to main content
QUICK REVIEW

[論文レビュー] Context-aware, Adaptive and Scalable Android Malware Detection through Online Learning (extended version)

A. Sankara Narayanan, Mahinthan Chandramohan|arXiv (Cornell University)|Jun 3, 2017
Advanced Malware Detection Techniques参考文献 38被引用数 7
ひとこと要約

本論文では、プログラム依存グラフ内のセキュリティ感受性の高い行動および文脈的依存関係を捉えるために、新規のグラフカーネルを用いた、文脈に配慮した、適応的でスケーラブルなオンライン学習フレームワークであるCasandraを提案する。ベンチマークデータセットでは99.23%のF-measureを達成し、実世界のアプリでは89.92%の精度を示し、バッチ学習設定では最先端手法を25%以上、継続的保持設定では7%以上上回る性能を発揮した。

ABSTRACT

It is well-known that Android malware constantly evolves so as to evade detection. This causes the entire malware population to be non-stationary. Contrary to this fact, most of the prior works on Machine Learning based Android malware detection have assumed that the distribution of the observed malware characteristics (i.e., features) does not change over time. In this work, we address the problem of malware population drift and propose a novel online learning based framework to detect malware, named CASANDRA (Contextaware, Adaptive and Scalable ANDRoid mAlware detector). In order to perform accurate detection, a novel graph kernel that facilitates capturing apps' security-sensitive behaviors along with their context information from dependency graphs is proposed. Besides being accurate and scalable, CASANDRA has specific advantages: i) being adaptive to the evolution in malware features over time ii) explaining the significant features that led to an app's classification as being malicious or benign. In a large-scale comparative analysis, CASANDRA outperforms two state-of-the-art techniques on a benchmark dataset achieving 99.23% F-measure. When evaluated with more than 87,000 apps collected in-the-wild, CASANDRA achieves 89.92% accuracy, outperforming existing techniques by more than 25% in their typical batch learning setting and more than 7% when they are continuously retained, while maintaining comparable efficiency.

研究の動機と目的

  • Androidマルウェアの継続的な進化と特徴の変化(特徴ドリフト)に起因する非定常なマルウェア集団の課題に対処すること。
  • 静的データ分布を仮定するバッチ学習モデルの限界を克服し、進化するマルウェアの特性に適応できないことの問題を解決すること。
  • 概念ドリフトに耐えながらも、長期間にわたり高い精度を維持できるスケーラブルで説明可能なマルウェア検出システムの開発。
  • プログラム依存グラフからの文脈的情報を統合し、構文的オブスクリューションに耐性のある意味的マルウェア行動の検出を向上させること。
  • 新規のマルウェアサンプルを再訓練なしに継続的にモデルに統合できるリアルタイムで適応可能な学習を可能にすること。

提案手法

  • プログラム依存グラフからの文脈的近傍ラベル列を組み込むことで、Weisfeiler-Lehmanカーネルを拡張した新規の文脈に配慮した重み付きグラフカーネル(CWLK)を提案する。
  • 明示的な特徴マッピングを用いてグラフをベクトルとして表現し、特徴重要度分析による解釈可能性と効率的な計算を実現する。
  • 新しいマルウェアサンプルが到着するたびに分類器を継続的に更新するオンライン学習を適用し、全履歴データの再トレーニングなしに概念ドリフトに適応する。
  • 制御・データ・プログラム依存グラフなどのプログラム表現グラフ(PRG)を活用し、コードのオブスクリューションに強く意味的行動を捉える。
  • APIコールシーケンスなどの最も重要な部分構造を特定・ランク付けする語彙ベースの特徴抽出機構を統合する。
  • CWLKカーネルとカーネルベース分類器(例:SVM)を組み合わせ、オンラインで段階的にグラフ分類を実行する。

実験結果

リサーチクエスチョン

  • RQ1どのようにすれば、進化を続けるAndroidマルウェア集団の非定常性に効果的に適応できるマルウェア検出システムを構築できるか?
  • RQ2プログラム依存グラフからの文脈的情報を統合することで、標準的なグラフカーネルと比較して、検出精度がどの程度向上するか?
  • RQ3オンライン学習フレームワークは、大規模なリアルタイムアプリストリームを処理しながら、長期間にわたり高い検出性能を維持できるか?
  • RQ4提案された文脈に配慮したグラフカーネルは、スケーラビリティ、正確性、解釈可能性の観点で、既存のグラフカーネルと比較してどのように差をつけるか?
  • RQ5概念ドリフトの存在下で、継続的なモデル更新が検出性能に与える影響は何か?

主な発見

  • Casandraはベンチマークデータセットで99.23%のF-measureを達成し、2つの最先端のバッチ学習手法を上回った。
  • 87,000個を超える実世界のAndroidアプリから成るデータセットでは、Casandraは89.92%の精度を示し、標準的なバッチ学習設定では既存手法を25%以上上回った。
  • 既存手法を継続的保持(新規データで再トレーニング)に適応させた場合でも、Casandraは依然として7%以上の精度で優位であった。
  • 提案された文脈に配慮したグラフカーネル(CWLK)は、分類意思決定の背後にある最も重要な文脈的特徴シーケンスを特定・ランク付けすることで、説明可能な検出を可能にした。
  • 1回の反復あたりO(he)の時間計算量を維持しており、標準的なWeisfeiler-Lehmanカーネルと同等の計算効率を実現し、大規模なアプリリポジトリへのスケーラビリティを保証した。
  • CWLKにおける明示的特徴マッピングの使用は、スケーラビリティと解釈可能性の両方を支援し、マルウェア行動パターンの特徴レベル分析を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。