Skip to main content
QUICK REVIEW

[논문 리뷰] Artificial Intelligence Based Malware Analysis

Avi Pfeffer, Brian E. Ruttenberg|arXiv (Cornell University)|2017. 04. 27.
Advanced Malware Detection Techniques참고 문헌 19인용 수 4
한 줄 요약

MAAGI 시스템은 인공지능과 생물학적으로 영감을 받은 방법—예를 들어 계통발생 분석과 확률적 모델링—을 적용하여 악성코드 분류, 행동 예측 및 근본 원인 규명을 자동화한다. 악성코드를 유전적 계통으로 모델링함으로써, 체계적 기능 문법과 제약 조건 해결 기법을 사용하여 API 호출 패턴을 분석하여 뱅커 계열 악성코드 행동의 정확한 특성화를 달성하고, 확장 가능한 AI 강화 악성코드 생태계 이해를 가능하게 한다.

ABSTRACT

Artificial intelligence methods have often been applied to perform specific functions or tasks in the cyber-defense realm. However, as adversary methods become more complex and difficult to divine, piecemeal efforts to understand cyber-attacks, and malware-based attacks in particular, are not providing sufficient means for malware analysts to understand the past, present and future characteristics of malware. In this paper, we present the Malware Analysis and Attributed using Genetic Information (MAAGI) system. The underlying idea behind the MAAGI system is that there are strong similarities between malware behavior and biological organism behavior, and applying biologically inspired methods to corpora of malware can help analysts better understand the ecosystem of malware attacks. Due to the sophistication of the malware and the analysis, the MAAGI system relies heavily on artificial intelligence techniques to provide this capability. It has already yielded promising results over its development life, and will hopefully inspire more integration between the artificial intelligence and cyber--defense communities.

연구 동기 및 목표

  • 기존 서명 기반 방법을 넘어서는 자동 분석을 통해 증가하는 악성코드의 복잡성과 양을 다루기 위해.
  • 진행 중인 악성코드 가문의 추적과 새로운 위협 탐지에 있어 수동 분석의 한계를 극복하기 위해.
  • AI 기반 모델링과 예측을 통해 악성코드 분석가가 과거, 현재, 미래의 악성코드 행동을 이해할 수 있도록 하기 위해.
  • 확률적 모델링, 계층적 클러스터링, 제약 조건 해결 기법 등 다양한 AI 기법을 통합하여 악성코드 분석을 위한 통합 시스템을 구축하기 위해.
  • 확장 가능하고 유연한 프레임워크를 통해 악성코드 생태계 분석에 있어 AI와 사이버 방어 공동체 간의 깊은 통합을 이끌어내기 위해.

제안 방법

  • 행동을 나타내는 동작과 명령어 구조를 언어적 탐색으로 표현하기 위해 체계적 기능 문법(SFG)을 사용하여 악성코드 행동을 모델링한다.
  • Copris를 통해 제약 조건 해결 기법을 적용하여 악성코드 행동 내 유효한 기능 조합을 평가하고, 문법 규칙에서 부울 표현식을 생성한다.
  • 계층적 클러스터링과 확률적 모델링을 활용하여 API 호출 패턴과 행동 유사성 기반으로 유사한 악성코드를 그룹화한다.
  • 계통발생 분석과 유전적 계통 모델링과 같은 생물학적으로 영감을 받은 기법을 활용하여 악성코드 가문 간의 관계와 진화 경로를 추론한다.
  • 정적 분석이 직접적인 접근을 제한할 경우, 시간적 및 데이터 흐름의 유사성을 대체로 사용하기 위해 호출 그래프 거리를 사용한다.
  • API 호출의 평균 유사도 기반으로 가능한 해석을 정렬함으로써 가장 가능성 있는 행동 해석을 우선순위화한다.

실험 결과

연구 질문

  • RQ1인공지능 기법을 활용하여 악성코드 가문의 진화를 어떻게 모델링하고 예측할 수 있는가?
  • RQ2계통발생학과 같은 생물학적으로 영감을 받은 방법이 악성코드 간의 관계와 확산을 이해하는 데 얼마나 적용될 수 있는가?
  • RQ3정적 분석으로 인한 데이터 흐름과 시간 정보의 제한에도 불구하고, 기능 문법 표현 방식이 악성코드 행동을 효과적으로 포괄하고 차별화할 수 있는가?
  • RQ4AI 강화 시스템은 악성코드 분석가의 트리지 및 심층 분석 워크플로우를 어떻게 향상시킬 수 있는가?
  • RQ5기반 기반 파싱과 확률적 모델링은 악성코드 근본 원인 규명과 행동 특성화 자동화에 어떤 역할을 할 수 있는가?

주요 결과

  • MAAGI 시스템은 283개의 압축 해제된 뱅커 계열 악성코드 샘플의 명령 및 제어 행동 및 개인 정보 유출 패tern을 성공적으로 특성화했다.
  • SFG 파서를 사용한 기능 분석은 다양한 악성코드 샘플에서 신뢰할 수 있는 작동을 보이며 정확한 행동 모델링을 가능하게 했다.
  • 시스템은 API 호출 패턴의 유사도 기반으로 다수의 유효한 행동 해석을 식별하고 이를 우선순위에 따라 정렬하여 이해 가능성과 우선순위 설정을 향상시켰다.
  • 정적 분석에서 데이터 흐름 및 시간적 특성을 포착하는 데 한계가 있었음에도 불구하고, 시스템은 호출 그래프 거리를 시간적 유사성의 타당한 대체 지표로 활용했다.
  • 확률적 모델링과 계층적 클러스터링을 포함한 AI 기법의 통합은 악성코드 가문 간 관계 및 행동 추세의 확장 가능한 탐지에 기여했다.
  • 이 프레임워크는 확장 가능하게 설계되어 향후 AI 기술 발전을 수용할 수 있으며, 악성코드 방어 능력의 지속적 진화를 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.