Skip to main content
QUICK REVIEW

[논문 리뷰] I-MAD: A Novel Interpretable Malware Detector Using Hierarchical Transformer.

Miles Q. Li, Benjamin C. M. Fung|arXiv (Cornell University)|2019. 09. 15.
Advanced Malware Detection Techniques참고 문헌 24인용 수 8
한 줄 요약

I-MAD는 기본 블록, 함수 및 실행 가능 파일 수준에서 어셈블리 코드를 분석하는 계층적 Transformer를 사용하는 새로운 해석 가능한 악성코드 탐지기입니다. 이는 기존의 최고 성능 모델을 능가하는 정적 악성코드 탐지 성능을 달성하면서도, 새로운 피처 기반 피드포워드 신경망을 통해 특징 수준의 해석을 제공합니다. 기존 방법의 한계를 극복하기 위해 전체 의미적 의미를 모델링하고 투명하고 실행 가능한 설명을 제공합니다.

ABSTRACT

Malware imposes tremendous threats to computer users nowadays. Since signature-based malware detection methods are neither effective nor efficient to identify new malware, many machine learning-based methods have been proposed. A common disadvantage of existing machine learning methods is that they are not based on understanding the full semantic meaning of assembly code of an executable. They rather use short assembly code fragments, because assembly code is usually too long to be modelled in its entirety. Another disadvantage is that those methods have either inferior performance or bad interpretability. To overcome these challenges, we propose an Interpretable MAware Detector (I-MAD), which achieves state-of-the-art performance on static malware detection with excellent interpretability. It integrates a hierarchical Transformer network that can understand assembly code at the basic block, function, and executable level. It also integrates our novel interpretable feed-forward neural network to provide interpretations for its detection results by pointing out the impact of each feature with respect to the prediction. Experiment results show that our model significantly outperforms previous state-of-the-art static malware detection models and presents meaningful interpretations.

연구 동기 및 목표

  • 기존 기계학습 기반 악성코드 탐지 방법에서의 낮은 해석 가능성과 제한된 의미 이해 문제를 해결하기 위해.
  • 짧은 어셈블리 조각에 의존하는 것에서 벗어나, 다양한 추상화 수준에서 전체 어셈블리 코드를 모델링하기 위해.
  • 높은 성능을 달성하면서도 예측에 대한 의미 있는 특징 수준의 설명을 제공하는 탐지 모델을 개발하기 위해.
  • 해석 가능한 딥 러닝과 계층적 표현 학습을 통합하여 악성코드 분석에서 신뢰도와 사용성을 향상시키기 위해.

제안 방법

  • I-MAD는 어셈블리 코드를 기본 블록, 함수, 전체 실행 가능 파일의 세 수준에서 인코딩하기 위해 계층적 Transformer 아키텍처를 사용합니다.
  • 다중 헤드 자기주의 메커니즘을 활용하여 어셈블리 지시어 간의 장거리 종속성과 의미 관계를 포착합니다.
  • 각 입력 특징이 최종 예측에 기여하는 정도를 정량화하기 위해 새로운 해석 가능한 피드포워드 신경망을 통합합니다.
  • 모델은 원시 디어셈블드 코드를 계층적 인코딩 파이프라인을 통해 처리하여 하위 수준에서 상위 수준으로 표현을 집계합니다.
  • 예측 점수를 개별 특징에 할당하여 해석 가능성을 확보함으로써 악성 코드 패턴을 식별할 수 있습니다.
  • 주의 기반 감독을 사용하는 교차 엔트로피 손실을 활용해 정적 악성코드 데이터셋에서 엔드 투 엔드로 훈련됩니다.

실험 결과

연구 질문

  • RQ1계층적 Transformer 모델은 악성코드 탐지에서 전체 어셈블리 코드의 의미적 의미를 효과적으로 포착할 수 있는가?
  • RQ2해석 가능한 피드포워드 네트워크의 통합이 성능을 희생시키지 않고도 모델의 투명성을 어떻게 향상시키는가?
  • RQ3I-MAD는 정확도와 강건성 측면에서 기존 최고 성능 정적 악성코드 탐지기보다 어느 정도 뛰어나게 성능을 발휘하는가?
  • RQ4모델은 인간 분석가가 악성 행동을 이해하는 데 부합하는 의미 있는 특징 수준의 설명을 제공할 수 있는가?

주요 결과

  • I-MAD는 정적 악성코드 탐지 벤치마크에서 최고 성능을 달성하여 이전의 최고 성능 모델들을 크게 능가합니다.
  • 특정 어셈블리 특징이 예측 결정에 가장 크게 기여하는 것을 식별함으로써 뛰어난 해석 가능성을 입증합니다.
  • 계층적 어텐션 메커니즘이 기본 블록, 함수, 전체 실행 가능 파일 수준에서 코드 의미 이해를 향상시킵니다.
  • 해석 가능한 피드포워드 네트워크의 통합으로 특징 중요도에 대한 일관되고 의미 있는 할당이 가능합니다.
  • 긴 복잡한 실행 가능 파일을 분석할 때도 높은 탐지 정확도를 유지합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.