Skip to main content
QUICK REVIEW

[论文解读] Can We Trust Your Explanations? Sanity Checks for Interpreters in Android Malware Analysis

Ming Fan, Wenying Wei|arXiv (Cornell University)|Aug 13, 2020
Advanced Malware Detection Techniques参考文献 43被引用 5
一句话总结

本文提出了一种框架,通过在五个恶意软件数据集和两个任务(恶意软件检测与家族识别)中应用三种定量指标——稳定性、鲁棒性和有效性——来评估Android恶意软件分析中解释方法的可靠性。结果表明,所提出的指标能有效评估解释质量,并揭示核心恶意行为,使安全关键场景下的分析师能够信任模型的解释结果。

ABSTRACT

With the rapid growth of Android malware, many machine learning-based malware analysis approaches are proposed to mitigate the severe phenomenon. However, such classifiers are opaque, non-intuitive, and difficult for analysts to understand the inner decision reason. For this reason, a variety of explanation approaches are proposed to interpret predictions by providing important features. Unfortunately, the explanation results obtained in the malware analysis domain cannot achieve a consensus in general, which makes the analysts confused about whether they can trust such results. In this work, we propose principled guidelines to assess the quality of five explanation approaches by designing three critical quantitative metrics to measure their stability, robustness, and effectiveness. Furthermore, we collect five widely-used malware datasets and apply the explanation approaches on them in two tasks, including malware detection and familial identification. Based on the generated explanation results, we conduct a sanity check of such explanation approaches in terms of the three metrics. The results demonstrate that our metrics can assess the explanation approaches and help us obtain the knowledge of most typical malicious behaviors for malware analysis.

研究动机与目标

  • 为解决在Android恶意软件分析中机器学习模型解释结果缺乏共识和信任的问题。
  • 识别解释方法在安全关键应用中必须满足的基本质量属性——稳定性、鲁棒性和有效性。
  • 为恶意软件分析中的解释方法提供一种系统化、定量的评估框架,适用于多样化的数据集和任务。
  • 通过实证验证五种主流解释方法(LIME、SHAP、LEMNA、DeepLIFT、SmoothGrad)在真实世界恶意软件检测和家族识别任务中的可靠性。
  • 证明所提出的指标不仅能评估解释质量,还能揭示具有代表性的恶意行为。

提出的方法

  • 设计一种基于三种定量指标的新颖评估框架:稳定性(输入扰动下解释的一致性)、鲁棒性(对对抗性输入变化的抗性能力)和有效性(解释特征与模型决策的相关性)。
  • 将该框架应用于五个在不同年份收集的广泛使用的Android恶意软件数据集,以确保时间多样性与现实相关性。
  • 开展两项主要任务:恶意软件检测(二分类)和家族识别(多分类),以在不同情境下测试解释性能。
  • 使用局部近似和基于扰动的解释技术,包括LIME、SHAP、LEMNA、DeepLIFT和SmoothGrad,生成模型预测的解释。
  • 通过同一输入的多次扰动下特征重要性的一致性来度量稳定性;通过对抗性输入修改下解释的变化来度量鲁棒性;通过解释特征与实际模型决策的相关性来度量有效性。
  • 在不同解释方法之间进行比较,以识别在所有三项指标下均表现可靠的解释方法,从而帮助安全分析师做出明智选择。

实验结果

研究问题

  • RQ1现有的Android恶意软件检测解释方法是否能在不同输入和扰动下产生一致且可靠的解释?
  • RQ2当面对旨在欺骗它们的对抗性输入修改时,解释方法的鲁棒性如何?
  • RQ3解释方法突出的特征在多大程度上与底层模型的实际决策机制相吻合?
  • RQ4所提出的指标——稳定性、鲁棒性和有效性——是否能够实现对恶意软件分析中解释质量的可靠且定量的评估?
  • RQ5在恶意软件检测和家族识别任务中,哪种解释方法在三项指标上整体表现最佳?

主要发现

  • 所提出的稳定性指标成功识别出在相同输入的多次扰动下能保持一致特征重要性排序的解释方法。
  • 鲁棒性指标揭示,部分解释方法(尤其是基于扰动的方法,如LIME和SHAP)对微小输入变化高度敏感,表明其可靠性较低。
  • 有效性指标表明,仅少数解释方法突出了对模型决策真正具有影响力的特征,其中DeepLIFT和SmoothGrad与实际模型行为的对齐程度更强。
  • 在所评估的五种方法中,DeepLIFT和SmoothGrad在所有三项指标中均持续表现更优,表明其在安全关键场景下具有更高的可靠性。
  • 该框架通过突出在模型预测中既稳定又有效的特征,成功识别出具有代表性的恶意行为,如特定系统权限和API调用。
  • 本研究证实,现有图像分类中的评估方法(例如,[16, 17, 18])不足以适用于恶意软件分析,原因在于其存在领域特异性挑战,如缺乏梯度访问和缺乏人工标注的真实标签。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。