Skip to main content
QUICK REVIEW

[論文レビュー] Can We Trust Your Explanations? Sanity Checks for Interpreters in Android Malware Analysis

Ming Fan, Wenying Wei|arXiv (Cornell University)|Aug 13, 2020
Advanced Malware Detection Techniques参考文献 43被引用数 5
ひとこと要約

本稿では、5つのマルウェアデータセットと2つのタスク(マルウェア検出および家族識別)にわたって適用された、安定性、耐性、有効性の3つの定量的指標を用いて、Androidマルウェア分析における説明手法の信頼性を評価するフレームワークを提案する。結果として、提案された指標が説明の質を効果的に評価し、根本的な悪意ある行動を明らかにできることを示し、セキュリティが重要な文脈におけるモデル解釈の信頼性を高めることを可能にする。

ABSTRACT

With the rapid growth of Android malware, many machine learning-based malware analysis approaches are proposed to mitigate the severe phenomenon. However, such classifiers are opaque, non-intuitive, and difficult for analysts to understand the inner decision reason. For this reason, a variety of explanation approaches are proposed to interpret predictions by providing important features. Unfortunately, the explanation results obtained in the malware analysis domain cannot achieve a consensus in general, which makes the analysts confused about whether they can trust such results. In this work, we propose principled guidelines to assess the quality of five explanation approaches by designing three critical quantitative metrics to measure their stability, robustness, and effectiveness. Furthermore, we collect five widely-used malware datasets and apply the explanation approaches on them in two tasks, including malware detection and familial identification. Based on the generated explanation results, we conduct a sanity check of such explanation approaches in terms of the three metrics. The results demonstrate that our metrics can assess the explanation approaches and help us obtain the knowledge of most typical malicious behaviors for malware analysis.

研究の動機と目的

  • Androidマルウェア分析における機械学習モデルの説明結果に対する合意形成の欠如と信頼性の欠如を解消すること。
  • セキュリティが重要なアプリケーションにおいて必須となる、説明手法が満たすべき基本的品質特性(安定性、耐性、有効性)を同定すること。
  • 多様なデータセットとタスクに適用可能な、原則的で定量的な説明手法の評価フレームワークを提供すること。
  • 実世界のマルウェア検出および家族識別タスクにおいて、5つの代表的な説明手法(LIME、SHAP、LEMNA、DeepLIFT、SmoothGrad)の信頼性を実証的に検証すること。
  • 提案された指標が説明の質を評価するだけでなく、代表的な悪意ある行動を特定できることを示すこと。

提案手法

  • 入力の摂動に対する一貫性(安定性)、敵対的入力変更に対する耐性(耐性)、モデル意思決定に対する関連性(有効性)の3つの定量的指標に基づく、新規の評価フレームワークを設計する。
  • 時間的多様性と現実世界の関連性を確保するため、異なる年数にわたって収集された5つの広く使われているAndroidマルウェアデータセットを用いる。
  • 説明性能を多様な文脈でテストするため、2つの主なタスク(マルウェア検出(2値分類)および家族識別(多クラス分類))を実施する。
  • ローカル近似および摂動ベースの説明技術(LIME、SHAP、LEMNA、DeepLIFT、SmoothGrad)を用いて、モデル予測の説明を生成する。
  • 同一入力の複数回の摂動における特徴の重要度の一貫性を測定することで安定性を評価し、敵対的入力変更による説明の変化を測定することで耐性を評価し、説明された特徴と実際のモデル意思決定との相関を測定することで有効性を評価する。
  • 説明手法間での結果を比較し、3つの指標すべてにおいて信頼性が高いとされる手法を特定し、セキュリティアナリストによる意思決定支援を可能にする。

実験結果

リサーチクエスチョン

  • RQ1Androidマルウェア検出用の既存の説明手法は、異なる入力や摂動に対しても一貫性があり信頼できる説明を生成できるか?
  • RQ2敵対的入力変更によって説明手法がどのように影響を受けるか、耐性はどの程度か?
  • RQ3説明手法が強調する特徴は、実際のモデル意思決定メカニズムとどの程度一致するか?
  • RQ4安定性、耐性、有効性の3つの指標は、マルウェア分析における説明の質を信頼性があり定量的に評価できるか?
  • RQ5マルウェア検出および家族識別タスクの両方において、3つの指標すべてで最も優れた性能を示すのはどの説明手法か?

主な発見

  • 提案された安定性指標は、同一入力の複数回の摂動において一貫した特徴重要度順位を生成する説明手法を的確に特定できた。
  • 耐性指標は、特にLIMEやSHAPのような摂動ベースの手法が微小な入力変更に対して非常に感受しやすく、信頼性が低いことを示している。
  • 有効性指標は、説明手法のうち一部のものしか、モデル意思決定に実際に関与する特徴を正しく強調できていないことを示しており、DeepLIFTとSmoothGradは実際のモデル行動と強い一致を示している。
  • 評価対象の5つの手法の中で、DeepLIFTとSmoothGradは3つの指標すべてにおいて一貫して高いスコアを示しており、セキュリティが重要な文脈においてより信頼性が高いと示唆されている。
  • 本フレームワークは、特定のシステム権限やAPIコールといった代表的な悪意ある行動を、安定的かつ有効に特徴として特定できており、モデル予測において安定的かつ有効な特徴を特定できた。
  • 本研究は、画像分類分野で用いられる既存の評価手法(例:[16, 17, 18])が、勾配アクセスの欠如や人間によるアノテーションのない正解データの欠如といったドメイン固有の課題のため、マルウェア分析には不十分であることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。