[논문 리뷰] HeNet: A Deep Learning Approach on Intel$^\circledR$ Processor Trace for Effective Exploit Detection
HeNet는 인텔® 프로세서 트레이스(Intel® PT)를 사용하여 저수준의 제어 흐름 트레이스를 시계열 이미지로 변환하여 악성코드 탐지를 수행하는 계층적 딥러닝 모델이다. 이러한 이미지에 대해 전이학습을 적용하고 트레이스 세그먼트 간의 예측을 앙상블함으로써 HeNet는 애드옵스® 리더에 대한 ROP 공격을 100% 정확도와 0% 위양성률로 탐지하며, 기존의 기계학습 방법들을 능가하고 동적 실행 트레이스에서의 적대적 변형에 대해 강건함을 입증한다.
This paper presents HeNet, a hierarchical ensemble neural network, applied to classify hardware-generated control flow traces for malware detection. Deep learning-based malware detection has so far focused on analyzing executable files and runtime API calls. Static code analysis approaches face challenges due to obfuscated code and adversarial perturbations. Behavioral data collected during execution is more difficult to obfuscate but recent research has shown successful attacks against API call based malware classifiers. We investigate control flow based characterization of a program execution to build robust deep learning malware classifiers. HeNet consists of a low-level behavior model and a top-level ensemble model. The low-level model is a per-application behavior model, trained via transfer learning on a time-series of images generated from control flow trace of an execution. We use Intel$^\circledR$ Processor Trace enabled processor for low overhead execution tracing and design a lightweight image conversion and segmentation of the control flow trace. The top-level ensemble model aggregates the behavior classification of all the trace segments and detects an attack. The use of hardware trace adds portability to our system and the use of deep learning eliminates the manual effort of feature engineering. We evaluate HeNet against real-world exploitations of PDF readers. HeNet achieves 100\% accuracy and 0\% false positive on test set, and higher classification accuracy compared to classical machine learning algorithms.
연구 동기 및 목표
- 정적 및 API 기반 동적 악성코드 탐지의 한계를 해결하기 위해, 이는 오브스컬레이션과 적대적 입력에 취약하기 때문이다.
- 하드웨어에서 생성된 제어 흐름 트레이스를 활용하여 향상된 강건성을 확보한 이식 가능하고 확장 가능한 악성코드 탐지 시스템을 개발하기 위해.
- 저수준의 제어 흐름 패킷을 딥러닝 모델의 입력으로 사용함으로써 수동적인 특징 공학을 제거하기 위해.
- 이미지로 변환된 제어 흐름 트레이스에 대해 계층적 앙상블 학습을 적용하여 탐지 정확도를 향상시키고 위양성률을 감소시키기 위해.
- 제어 흐름 행동의 변형을 분석하여 모델의 적대적 공격에 대한 내성을 평가하기 위해.
제안 방법
- 인텔® PT가 생성한 제어 흐름 트레이스 패킷을 지시어 실행 경로를 나타내는 2차원 픽셀 이미지의 시퀀스로 변환한다.
- 제어 흐름 트레이스에서 파생된 고해상도 이미지 시퀀스를 기반으로 전이학습을 통해 저수준의 딥 네트워크를 훈련시켜 응용 프로그램 전용 행동을 모델링한다.
- 모든 트레이스 세그먼트의 예측을 집계하여 악성 실행을 나타내는 이질성을 탐지하기 위해 최상위 수준의 앙상블 모델을 사용한다.
- 고해상도 및 저해상도 모델의 볼록 조합을 적용하여 정확도와 위양성률을 최적화하며, 최적 성능을 위해 초모수 α를 조정한다.
- 간접 및 조건부 브랜치 트레이스의 세밀한 특성을 활용하여 정상 프로그램 행동에서의 미세한 이탈을 포착한다.
- 이미지 시퀀스를 기반으로 훈련된 ResNet 기반 아키텍처를 사용하여 정상 대 비정상 제어 흐름 패턴을 분류한다.
실험 결과
연구 질문
- RQ1인텔® PT가 생성한 제어 흐름 트레이스가 딥러닝 기반 악성코드 분류에 적합한 이미지 표현으로 효과적으로 변환될 수 있는가?
- RQ2전이학습된 행동 모델을 조합한 계층적 앙상블 모델이 기존 기계학습 방법에 비해 탐지 정확도를 향상시키고 위양성률을 감소시키는가?
- RQ3응용 프로그램 기능을 유지하면서 실행 경로를 변경하는 제어 흐름의 적대적 변형에 대해 HeNet 모델은 얼마나 강건한가?
- RQ4하드웨어 기반 트레이싱을 사용함으로써 다양한 운영 체제 및 하드웨어 플랫폼 간에 악성코드 탐지 시스템의 이식성과 확장성을 향상시킬 수 있는가?
- RQ5저해상도 및 고해상도 모델의 앙상블에서 모델 해상도와 성능 사이의 최적의 트레이드오프는 무엇인가?
주요 결과
- HeNet는 애드옵스® 리더에 대한 실제 세계의 ROP 공격 테스트 세트에서 100% 탐지 정확도와 0% 위양성률을 달성했다.
- 볼록 조합(α = 0.5)을 적용한 앙상블 모델은 98.31% 정확도와 0.29% 위양성률을 기록하여 고해상도 및 저해상도 모델 각각을 개별적으로 사용한 경우보다 뛰어난 성능을 보였다.
- 고해상도 모델(224×224×3)은 98.1% 정확도와 0.73% 위양성률을 기록했고, 저해상도 모델(28×28×3)은 97.6% 정확도와 0.22% 위양성률을 기록했다.
- 전이학습 덕분에 저수준 행동 모델의 수렴 속도가 빨라졌으며, 훈련이 10 에포크 내에 안정화되었다.
- 운영 체제나 소프트웨어 스택과 독립적인 하드웨어 수준의 제어 흐름 트레이스를 사용함으로써 시스템은 높은 이식성과 확장성을 확보했다.
- 세밀한 행동 모델링 덕분에 악성 전이를 탐지하지 못하게 하기가 어려워, 모델은 적대적 제어 흐름 조작에 대해 강력한 내성을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.