[논문 리뷰] ITect: Scalable Information Theoretic Similarity for Malware Detection
ITect는 바이트 n-그램에 대해 엔트로피 기반 패턴(EnTS)과 통계적 언어 모델(SLaMM)을 사용하는 확장 가능한 정보이론적 악성코드 탐지 시스템으로, 혼합 악성코드 데이터셋에서 100% 정밀도와 90.3% 정확도를 달성하며, 동적 분석이나 역공학 분석 없이 선형 시간 내에 작동하면서, VirusTotal의 모든 56개 악성코드 검사 엔진을 초월한다.
Malware creators have been getting their way for too long now. String-based similarity measures can leverage ground truth in a scalable way and can operate at a level of abstraction that is difficult to combat from the code level. We introduce ITect, a scalable approach to malware similarity detection based on information theory. ITect targets file entropy patterns in different ways to achieve 100% precision with 90% accuracy but it could target 100% recall instead. It outperforms VirusTotal for precision and accuracy on combined Kaggle and VirusShare malware.
연구 동기 및 목표
- 다양하고 복잡한 다형성 및 다형성 악성코드의 증가하는 양과 복잡성으로 인한 확장성 및 회피 도전 과제를 해결하기 위해.
- 동적 분석, 역공학 분석, 인간 간섭 없이 작동하는 탐지 방법을 개발하여 비용을 줄이고 자동화를 증진하기 위해.
- 원시 바이트 스트링에서 정보이론적 유사도를 활용해 고수준 추상화 수준에서 악성코드를 탐지함으로써 악성코드 제작자가 이를 우회하기 어려운 방식을 확보하기 위해.
- 특히 가짜 경고가 수용 불가능한 데스크톱 악성코드 분석 환경에서 높은 정밀도와 정확도를 달성하기 위해.
- 실제 데이터셋을 사용하여 압축, 다형성, 다형성 변종을 포함한 다양한 악성코드 유형에 대해 강력한 성능을 입증하기 위해.
제안 방법
- 파일 엔트로피의 진폭과 종방향 변동성에서 단순화된 서명을 추출하기 위해 EnTS를 사용하여 이를 기계학습 특성으로 간주하기 위해.
- 악성코드(M) 및 양성 소프트웨어(B) 지우에서 n-그램 언어 모델을 구축하여 바이트 수준 패턴의 통계적 규칙성을 포착하기 위해.
- 세 가지 정보이론적 측정치인 상호엔트로피, 쿨백-라이블러 발산, 평균 제곱오차를 적용하여 의심 파일의 n-그램 분포를 M 및 B 모델과 비교하기 위해.
- 모든 세 하위분류기(M 및 B 모델 기반)가 일치할 경우에만 파일을 악성코드로 분류함으로써 정밀도를 보장하기 위해.
- 사전 처리, 동적 실행, 정적 분석 없이 원시 바이트 스트링을 직접 운영함으로써 선형 시간 복잡도를 확보하기 위해.
- EnTS와 SLaMM를 상호보완적인 탐지기로 통합: EnTS는 엔트로피 패턴을 통해 다형성 악성코드를 탐지하고, SLaMM는 통계적 언어 모델링을 통해 다형성 및 압축된 악성코드를 탐지하기 위해.
실험 결과
연구 질문
- RQ1원시 바이트 스트링에서 작동하는 정보이론적 유사도 측정치는 동적 분석이나 역공학 분석 없이도 높은 정밀도와 정확도로 악성코드를 탐지할 수 있는가?
- RQ2엔트로피 패턴과 n-그램 언어 모델은 다형성, 다형성, 압축된 변종을 포함한 다양한 악성코드 가족을 어느 정도 탐지할 수 있는가?
- RQ3ITect의 성능은 기존의 악성코드 검사 엔진과 비교해 어떻게 되는가? 특히 실제 악성코드 데이터셋에서 정밀도와 정확도 측면에서 어떻게 되는가?
- RQ4실행에 의존하지 않는 선형 시간 방법은 테스트 세트에서 다양한 비율의 악성코드를 포함할 경우에도 강력한 탐지 성능을 달성할 수 있는가?
- RQ5양성 및 악성코드 지우에서 훈련된 통계적 언어 모델을 사용하여 정보이론적 발산 기반으로 악성코드와 양성 소프트웨어를 효과적으로 구분할 수 있는가?
주요 결과
- ITect는 30,000개의 악성코드 파일과 2,000개의 양성 파일로 구성된 혼합 데이터셋에서 100% 정밀도와 90.3% 정확도를 달성하였으며, 이는 VirusTotal의 모든 56개 엔진을 초월하였다.
- 가장 성능이 뛰어난 VirusTotal 엔진은 99.4% 정밀도를 기록했지만 정확도는 71.4%에 머물렀으며, 이는 ITect가 훨씬 더 높은 종합 정확도를 제공한다는 것을 보여준다.
- ITect의 정밀도는 테스트 세트 내 악성코드 비율이 50%에서 0%로 감소함에 따라도 항상 100% 유지되었으며, 정확도는 향상되었다.
- EnTS와 SLaMM 구성 요소 모두 각각 전용으로 설계되지 않은 악성코드 유형을 탐지하였다—EnTS는 압축/암호화된 영역로 인해 다형성 악성코드를 탐지하였고, SLaMM는 양성 모델에서 낮은 엔트로피로 인해 다형성 악성코드를 탐지하였다.
- ITect의 시간 복잡도는 파일 수에 대해 선형이므로, 대규모 악성코드 분석 파이프라인에서의 확장 가능한 구현이 가능하다.
- 이 방법은 실행에 의존하지 않으며 원시 스트링을 직접 운영하므로 가상 머신, 샌드박스, 또는 역공학 분석이 필요 없으며, 인간적 및 계산적 오버헤드를 줄인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.