Skip to main content
QUICK REVIEW

[論文レビュー] Feature-level Malware Obfuscation in Deep Learning

Keith Dillon|arXiv (Cornell University)|Feb 10, 2020
Advanced Malware Detection Techniques参考文献 24被引用数 5
ひとこと要約

本稿では、深層学習ベースの検出を回避するために、マルウェアに善い特徴(例:Intents、Permissions、API呼び出し)を埋め込むことで、マルウェアのオブスクリュエーションを新たに提案する。拡張データ上で訓練された深層ニューラルネットワークにより、攻撃に対して高い耐性を示し、APIベースの特徴がIntents や Permissions だけよりも顕著に耐性があることが判明。オブスクリュエーション下でも誤検出率(FNR)を著しく低減した。

ABSTRACT

We consider the problem of detecting malware with deep learning models, where the malware may be combined with significant amounts of benign code. Examples of this include piggybacking and trojan horse attacks on a system, where malicious behavior is hidden within a useful application. Such added flexibility in augmenting the malware enables significantly more code obfuscation. Hence we focus on the use of static features, particularly Intents, Permissions, and API calls, which we presume cannot be ultimately hidden from the Android system, but only augmented with yet more such features. We first train a deep neural network classifier for malware classification using features of benign and malware samples. Then we demonstrate a steep increase in false negative rate (i.e., attacks succeed), simply by randomly adding features of a benign app to malware. Finally we test the use of data augmentation to harden the classifier against such attacks. We find that for API calls, it is possible to reject the vast majority of attacks, where using Intents or Permissions is less successful.

研究の動機と目的

  • 深層学習モデルがマルウェア検出において特徴レベルのオブスクリュエーションに対してどれほど脆弱であるかを調査すること。
  • マルウェアに善い特徴を挿入するオブスクリュエーション攻撃に対して、データ拡張がモデルの耐性を高める有効性を評価すること。
  • 異なる静的特徴(API呼び出し、Intents、Permissions)がこのようなオブスクリュエーションに対してどれほど耐性を示すかを比較すること。
  • 善い特徴の存在に関係なく不変となるようにモデルを訓練できるか、かつ検出精度を維持できるかを検討すること。

提案手法

  • 静的Androidアプリケーション特徴(API、Intents、Permissions)を用いて、20層の全結合層(各1024ユニット)を持つ深層順伝播ニューラルネットワークを訓練した。
  • クリーンなアプリから得た善い特徴をランダムにマルウェアサンプルに追加することで、機能を保持したまま改ざんマルウェアサンプルを生成した。
  • 元の訓練サンプルと改ざんサンプルの混合データセットを用いて再訓練することで、モデルの耐性を向上させるデータ拡張を適用した。
  • ReLU活性化関数とAdam最適化を用い、バイナリクロスエントロピー損失を用い、保留されたテストセットを用いてモデルを評価した。
  • クリーンなテストセットと改ざんテストセットの両方で、正解率、偽陰性率(FNR)、偽陽性率(FPR)を用いて性能を評価した。
  • 異なる特徴タイプ(APIのみ、Intents + Permissions、すべての3つ)の間でモデル性能を比較し、特徴の耐性を評価した。

実験結果

リサーチクエスチョン

  • RQ1善い特徴をマルウェアに挿入することで、特徴レベルのオブスクリュエーションがなされた場合、深層学習モデルはどれほど脆弱であるか?
  • RQ2改ざんサンプルを用いたアドバーシャルトレーニングによるデータ拡張は、このような攻撃下で偽陰性率を顕著に低減できるか?
  • RQ3API呼び出し、Intents、Permissions のうち、どれがマルウェア検出においてオブスクリュエーションに対して最も耐性を示すか?
  • RQ4拡張データで訓練されたモデルは、クリーンデータにおけるベースライン性能を維持しつつ、オブスクリュエーションに対してどれほど耐性を示せるか?

主な発見

  • 善い特徴をマルウェアにランダムに挿入したことで、偽陰性率が著しく上昇し、標準的な深層学習モデルがこのようなオブスクリュエーションに対して極めて脆弱であることが示された。
  • Intents や Permissions のみを特徴として用いた場合、オブスクリュエーション下で性能が著しく低下し、APIベースのモデルと比較して顕著に高い偽陰性率を示した。
  • APIベースのモデルは高い耐性を示し、データ拡張を適用した場合、改ざんテストセットでもほぼベースライン性能を達成した。
  • API、Intents、Permissions のすべての特徴タイプを組み合わせ、データ拡張を適用したことで、耐性が顕著に向上し、クリーンデータでのベースライン正解率にほぼ等しい性能を達成した。
  • 改ざんデータで訓練したモデルは、API特徴を用いた場合、改ざんテストセットで偽陰性率が10%未満に抑えられ、特徴レベルのオブスクリュエーションに対して強い抵抗性を示した。
  • 本研究は、データ拡張により、深層ネットワークが善い特徴の量に依存しない不変性を持つようにプログラミングできることを示しており、悪意ある信号に焦点を当てた非対称検出器として機能することが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。