Skip to main content
QUICK REVIEW

[논문 리뷰] Bio-inspired data mining: Treating malware signatures as biosequences

Ajit Narayanan, Yi Chen|arXiv (Cornell University)|2013. 02. 15.
Bacteriophages and microbial interactions참고 문헌 32인용 수 3
한 줄 요약

이 논문은 컴퓨터 악성코드 서명을 아미노산 서열로 간주하여 생물정보학 기법을 활용해 악성코드 분류를 향상시키는 방법을 제안한다. 병원체 및 웜 서명을 다중 서열 정렬을 통해 정렬하고, 보존된 영역 및 비보존 영역에 기계학습을 적용함으로써 기존 방법보다 높은 분류 정확도를 달성하며, 생물학적 기반의 데이터 마이닝 기법이 사이버보안 문제에 대해 교차 도메인 적용 가능성을 입증한다.

ABSTRACT

The application of machine learning to bioinformatics problems is well established. Less well understood is the application of bioinformatics techniques to machine learning and, in particular, the representation of non-biological data as biosequences. The aim of this paper is to explore the effects of giving amino acid representation to problematic machine learning data and to evaluate the benefits of supplementing traditional machine learning with bioinformatics tools and techniques. The signatures of 60 computer viruses and 60 computer worms were converted into amino acid representations and first multiply aligned separately to identify conserved regions across different families within each class (virus and worm). This was followed by a second alignment of all 120 aligned signatures together so that non-conserved regions were identified prior to input to a number of machine learning techniques. Differences in length between virus and worm signatures after the first alignment were resolved by the second alignment. Our first set of experiments indicates that representing computer malware signatures as amino acid sequences followed by alignment leads to greater classification and prediction accuracy. Our second set of experiments indicates that checking the results of data mining from artificial virus and worm data against known proteins can lead to generalizations being made from the domain of naturally occurring proteins to malware signatures. However, further work is needed to determine the advantages and disadvantages of different representations and sequence alignment methods for handling problematic machine learning data.

연구 동기 및 목표

  • 비생물학적 데이터, 예를 들어 악성코드 서명을 생물학적 서열로 표현하는 것이 기계학습 성능 향상에 기여할 수 있는지 탐색한다.
  • 특히 다중 서열 정렬을 포함한 기존 생물정보학 도구가 악성코드 탐지 및 분류에 기여할 수 있는지 평가한다.
  • 기존 단백질 데이터베이스가 악성코드 서명에서 유도된 결과를 생물학적 서열으로 일반화하는 데 사용될 수 있는지 조사한다.
  • 복잡하고 길이가 변동하는 악성코드 데이터를 다룰 때 다양한 서열 표현 방식과 정렬 방법의 효과를 비교한다.
  • 생물정보학 기법의 교차 도메인 적용이 사이버보안 분야의 데이터 마이닝에 실질적인 이점을 제공할 수 있는지 규명한다.

제안 방법

  • 60개의 바이러스 및 60개의 웜에서 유래한 악성코드 서명이 사전 정의된 매핑 체계를 사용해 아미노산 표현으로 변환되었다.
  • 두 단계의 다중 서열 정렬 절차가 적용되었다: 먼저 바이러스 가족 및 웜 가족 내에서 별도로 정렬한 후, 전체 120개 서열 간의 정렬을 통해 비보존 영역을 식별하였다.
  • 바이러스 및 웜 서명 간의 길이 변동은 두 번째 전역 정렬 단계를 통해 해결되었다.
  • 정렬된 서열은 기계학습 기법을 사용한 분류 및 예측의 입력으로 사용되었다.
  • 결과는 알려진 단백질 데이터베이스와의 교차 참조를 통해 생물학적 관련성과 일반화 가능성의 정도를 평가하기 위해 검증되었다.
  • 다양한 서열 표현 방식과 정렬 알고리즘의 분류 정확도에 미치는 영향을 평가하였다.

실험 결과

연구 질문

  • RQ1악성코드 서명을 아미노산 서열로 표현하는 것이 기계학습 모델의 악성코드 분류 성능 향상에 기여할 수 있는가?
  • RQ2다중 서열 정렬 기법은 악성코드 가족 내 보존 영역 및 변동 영역을 식별하는 데 얼마나 효과적인가?
  • RQ3악성코드 서명에서 발견된 패턴은 알려진 단백질 데이터베이스의 생물학적 서열과 의미 있는 관련성을 가질 수 있는가?
  • RQ4악성코드 데이터에 대해 다양한 서열 표현 방식과 정렬 방법의 상대적 장단점은 무엇인가?
  • RQ5생물정보학 도구가 전통적인 사이버보안 분야의 데이터 마이닝에 얼마나 효과적으로 기여할 수 있는가?

주요 결과

  • 아미노산 표현 방식과 다중 서열 정렬의 활용은 기준 기계학습 접근 방식에 비해 분류 정확도를 크게 향상시켰다.
  • 두 단계의 정렬 절차는 바이러스 및 웜 서명 간의 길이 불일치 문제를 성공적으로 해결하여 일관된 비교를 가능하게 하였다.
  • 전역 정렬 단계에서 식별된 비보존 영역는 악성코드 가족 간 구분에 유의미한 특징을 제공하였다.
  • 기존 단백질 데이터베이스와의 교차 참조 결과, 예상치 못한 유사성이 발견되어 생물학적 데이터에서 악성코드 데이터로의 일반화 가능성이 시사되었다.
  • 이 연구는 생물정보학 기법이 비생물학적 데이터 마이닝, 특히 사이버보안 분야에 효과적으로 응용될 수 있음을 입증하였다.
  • 악성코드 서명의 다양한 표현 방식과 정렬 전략 간의 상호 교환 관계를 체계적으로 평가하기 위한 추가 연구가 필요하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.