Skip to main content
QUICK REVIEW

[논문 리뷰] Malware Analysis using Multiple API Sequence Mining Control Flow Graph

Anishka Singh, Rohit Arora|arXiv (Cornell University)|2017. 07. 10.
Advanced Malware Detection Techniques참고 문헌 8인용 수 4
한 줄 요약

이 논문은 제어 흐름 그래프(CFGs)에서 다중 API 시퀀스 마이닝을 사용하여 시스템 호출의 n-gram 패턴을 추출함으로써 악성코드 패밀리를 탐지하는 악성코드 분석 프레임워크를 제안한다. 이러한 시퀀스에 유사도 스코어링 기법을 적용함으로써, 가급적 오브스큐레이션에도 불구하고 악성코드 변종을 높은 정확도로 식별할 수 있으며, 강력한 실험적 성능을 보이는 스케일러블한 패밀리 기반 탐지 솔루션을 제공한다.

ABSTRACT

Malwares are becoming persistent by creating full- edged variants of the same or different family. Malwares belonging to same family share same characteristics in their functionality of spreading infections into the victim computer. These similar characteristics among malware families can be taken as a measure for creating a solution that can help in the detection of the malware belonging to particular family. In our approach we have taken the advantage of detecting these malware families by creating the database of these characteristics in the form of n-grams of API sequences. We use various similarity score methods and also extract multiple API sequences to analyze malware effectively.

연구 동기 및 목표

  • 코드 오브스큐레이션에도 불구하고 기능적 특성을 공유하는 진화하는 악성코드 패밀리 탐지의 과제를 해결하기 위해.
  • 제어 흐름 그래프 내 시스템 호출 시퀀스에서 파생된 행동 패턴을 활용하여 악성코드 탐지를 향상시키기 위해.
  • 원시 코드가 아닌 API 시퀀스의 n-gram을 사용하여 서명 기반의 스케일러블한 탐지 메커니즘을 개발하기 위해.
  • 다양한 샘플 간 악성코드 패밀리 식별에 있어 다중 유사도 스코어링 방법의 효과를 평가하기 위해.
  • 행동 기반 API 시퀀스를 사용한 자동화된 악성코드 분류를 위한 경량이고 효율적인 프레임워크를 만들기 위해.

제안 방법

  • 해석된 악성코드 바이너리에서 제어 흐름 그래프(CFGs)를 구축하여 프로그램 실행 경로를 모델링한다.
  • CFGs에서 응용 프로그래밍 인터페이스(API) 호출 시퀀스를 추출하여 패턴 분석을 위한 n-gram으로 간주한다.
  • 여러 유사도 스코어링 방법(예: 재스카드, 코사인, 타니모토)을 사용하여 악성코드 샘플 간의 API 시퀀스 패턴을 비교한다.
  • 이러한 n-gram 패턴을 사용하여 알려진 악성코드 패밀리 서명 데이터베이스를 구축하여 효율적인 검색과 분류를 수행한다.
  • 간접 호출(예: call rax, jmp rbx)을 처리하기 위해 정적 분석을 활용하여 맥락과 히وري스틱 기반으로 가능한 API 대상을 추론한다.
  • 오브스큐레이션과 코드 변형에 대비해 유사도 스코어를 다중 시퀀스 윈도우에 걸쳐 평가함으로써 강건성을 향상시킨다.

실험 결과

연구 질문

  • RQ1제어 흐름 그래프 내 API 시퀀스의 n-gram 패턴이 악성코드 패밀리 간에 효과적으로 구분 가능한가?
  • RQ2다양한 유사도 스코어링 방법(예: 재스카드, 코사인)이 관련된 악성코드 샘플을 식별하는 데 어떻게 비교되는가?
  • RQ3이 방법은 동일한 패밀리에 属하는 오브스큐레이션되거나 변형된 악성코드를 어느 정도 탐지할 수 있는가?
  • RQ4이 방법은 낮은 오진율을 유지하면서도 대규모 악성코드 코퍼스에 대해 효율적으로 스케일링할 수 있는가?
  • RQ5오브스큐레이션된 바이너리에서 간접적 또는 동적 API 호출에 대해 이 방법은 얼마나 내성적인가?

주요 결과

  • 이 방법은 제어 흐름 그래프에서 추출한 API 시퀀스의 n-gram 패턴을 사용하여 악성코드 패밀리 식별에 높은 정확도를 달성한다.
  • 재스카드 및 타니모토와 같은 유사도 스코어링 기법이 관련된 악성코드 샘플을 매칭하는 데 강력한 성능을 보였다.
  • 코드가 오브스큐레이션되거나 재구성되어도 이 프레임워크는 알려진 악성코드 패밀리의 변종을 성공적으로 탐지한다.
  • 단일 시퀀스 분석에 비해 다중 API 시퀀스를 사용함으로써 강건성이 향상되어 거짓 음성 감소 효과를 보였다.
  • n-gram의 압축된 표현 방식과 효율적인 유사도 계산 덕분에 이 방법은 잘 스케일링된다.
  • 맥락 인식 히وري스틱을 사용하여 간접 호출(call rax 등)를 효과적으로 처리함으로써 가능한 API 대상을 추론한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.