Skip to main content
QUICK REVIEW

[논문 리뷰] Can We Trust Your Explanations? Sanity Checks for Interpreters in Android Malware Analysis

Ming Fan, Wenying Wei|arXiv (Cornell University)|2020. 08. 13.
Advanced Malware Detection Techniques참고 문헌 43인용 수 5
한 줄 요약

이 논문은 안드로이드 악성코드 분석에서 설명 방법의 신뢰성을 평가하기 위한 프레임워크를 제안한다. 세 가지 정량적 지표—안정성, 내성, 효과성—을 활용하여 다섯 개의 악성코드 데이터셋과 두 가지 작업(악성코드 탐지 및 가족 식별)에 적용한다. 결과적으로 제안된 지표들이 설명 품질을 효과적으로 평가하고 악성 행동의 핵심을 드러내어 보안 핵심 환경에서 모델의 해석을 신뢰할 수 있도록 한다.

ABSTRACT

With the rapid growth of Android malware, many machine learning-based malware analysis approaches are proposed to mitigate the severe phenomenon. However, such classifiers are opaque, non-intuitive, and difficult for analysts to understand the inner decision reason. For this reason, a variety of explanation approaches are proposed to interpret predictions by providing important features. Unfortunately, the explanation results obtained in the malware analysis domain cannot achieve a consensus in general, which makes the analysts confused about whether they can trust such results. In this work, we propose principled guidelines to assess the quality of five explanation approaches by designing three critical quantitative metrics to measure their stability, robustness, and effectiveness. Furthermore, we collect five widely-used malware datasets and apply the explanation approaches on them in two tasks, including malware detection and familial identification. Based on the generated explanation results, we conduct a sanity check of such explanation approaches in terms of the three metrics. The results demonstrate that our metrics can assess the explanation approaches and help us obtain the knowledge of most typical malicious behaviors for malware analysis.

연구 동기 및 목표

  • 안드로이드 악성코드 분석에서 기계학습 모델의 설명 결과에 대한 공감대 부족과 신뢰 문제를 해결하기 위해.
  • 보안 핵심 응용 분야에서 요구하는 기본적인 품질 특성—안정성, 내성, 효과성—을 식별하기 위해.
  • 다양한 데이터셋과 작업에 적용 가능한 원칙적이고 정량적인 설명 방법 평가 프레임워크를 제공하기 위해.
  • 실세계의 악성코드 탐지 및 가족 식별 작업에서 다섯 가지 주요 설명 방법(LIME, SHAP, LEMNA, DeepLIFT, SmoothGrad)의 신뢰성을 실증적으로 검증하기 위해.
  • 제안된 지표들이 설명 품질 평가를 넘어서 실제 악성 행동을 드러내는 데에도 기여할 수 있음을 보여주기 위해.

제안 방법

  • 입력의 변형에 대한 설명의 일관성(안정성), 악성 입력 변경에 대한 저항성(내성), 모델 결정에 대한 설명 기능의 관련성(효과성)을 기반으로 한 세 가지 정량적 지표를 활용한 새로운 평가 프레임워크를 설계한다.
  • 시간적 다양성과 실제 적용 가능성을 확보하기 위해 다양한 연도에 수집된 다섯 개의 널리 사용되는 안드로이드 악성코드 데이터셋을 활용한다.
  • 설명 성능을 다양한 맥락에서 테스트하기 위해 악성코드 탐지(이元 분류)와 가족 식별(다중 분류)이라는 두 가지 주요 작업을 수행한다.
  • 로컬 근사 및 편향 기반 설명 기법인 LIME, SHAP, LEMNA, DeepLIFT, SmoothGrad를 사용하여 모델 예측의 설명을 생성한다.
  • 동일한 입력에 대한 다수의 편향에서 특성 중요도 일관성으로 안정성 측정; 악성 입력 수정에 따른 설명 변화로 내성 측정; 실제 모델 결정과의 상관관계로 효과성 측정.
  • 다양한 설명 방법 간 결과 비교를 통해 세 가지 지표에서 모두 높은 성능을 보이는 방법을 식별하여 보안 분석가가 정보 기반으로 선택할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1기존의 안드로이드 악성코드 탐지 설명 방법은 다양한 입력과 편향에 대해 일관되고 신뢰할 수 있는 설명을 생성할 수 있는가?
  • RQ2악성 입력 수정을 통해 설명 방법이 속임을 당할 가능성이 있는가?
  • RQ3설명 방법이 강조한 특성들이 실제 모델의 결정 메커니즘과 어느 정도 일치하는가?
  • RQ4제안된 지표인 안정성, 내성, 효과성이 악성코드 분석에서 설명 품질을 신뢰성 있고 정량적으로 평가하는 데 기여하는가?
  • RQ5악성코드 탐지 및 가족 식별 작업 전반에서 세 가지 지표에서 가장 우수한 성능을 보이는 설명 방법은 무엇인가?

주요 결과

  • 제안된 안정성 지표는 동일한 입력에 대한 다수의 편향에서 일관된 특성 중요도 순서를 생성하는 설명 방법을 성공적으로 식별한다.
  • 내성 지표는 LIME 및 SHAP와 같은 편향 기반 방법이 소량의 입력 변화에도 매우 민감하여 낮은 신뢰성을 보임을 드러낸다.
  • 효과성 지표는 오직 일부 설명 방법만이 실제 모델 결정에 영향을 미치는 특성들을 강조함을 보여주며, DeepLIFT과 SmoothGrad가 실제 모델 행동과 더 잘 일치함을 확인한다.
  • 평가된 다섯 가지 방법 중 DeepLIFT과 SmoothGrad는 세 가지 지표에서 일관되게 높은 순위를 기록하여 보안 핵심 환경에서 더 높은 신뢰성을 보임을 시사한다.
  • 프레임워크는 안정적이고 효과적인 특성들을 강조함으로써 특정 시스템 권한과 API 호출과 같은 대표적인 악성 행동을 성공적으로 식별하였다.
  • 기존의 이미지 분류 평가 방법([16, 17, 18] 등)은 기울기 접근이 불가능하고 인간 주석 기반 참값이 없는 도메인 특수 과제로 인해 악성코드 분석에는 부적합함을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.