Skip to main content
QUICK REVIEW

[논문 리뷰] Adversarial Binaries for Authorship Identification

Xiaozhu Meng, Barton P. Miller|arXiv (Cornell University)|2018. 09. 21.
Adversarial Robustness in Machine Learning참고 문헌 28인용 수 10
한 줄 요약

이 논문은 기계 학습 분류기의 저자 식별을 회피하기 위해 기능적으로 동일한 유효한 바이너리를 생성하는 새로운 적대적 공격 프레임워크를 제시한다. 프로그램 기능인 함수 호출과 심벌 등을 도구적으로 바이너리 재작성하여 수정함으로써, 공격은 비타겟팅 공격에서 96%의 성공률, 타겟팅 공격에서 46%의 성공률를 기록하며, 쉽게 조작 가능한 코드 기능에 기반한 현재의 저자 식별 시스템의 취약성을 드러낸다.

ABSTRACT

Binary code authorship identification determines authors of a binary program. Existing techniques have used supervised machine learning for this task. In this paper, we look this problem from an attacker's perspective. We aim to modify a test binary, such that it not only causes misprediction but also maintains the functionality of the original input binary. Attacks against binary code are intrinsically more difficult than attacks against domains such as computer vision, where attackers can change each pixel of the input image independently and still maintain a valid image. For binary code, even flipping one bit of a binary may cause the binary to be invalid, to crash at the run-time, or to lose the original functionality. We investigate two types of attacks: untargeted attacks, causing misprediction to any of the incorrect authors, and targeted attacks, causing misprediction to a specific one among the incorrect authors. We develop two key attack capabilities: feature vector modification, generating an adversarial feature vector that both corresponds to a real binary and causes the required misprediction, and input binary modification, modifying the input binary to match the adversarial feature vector while maintaining the functionality of the input binary. We evaluated our attack against classifiers trained with a state-of-the-art method for authorship attribution. The classifiers for authorship identification have 91% accuracy on average. Our untargeted attack has a 96% success rate on average, showing that we can effectively suppress authorship signal. Our targeted attack has a 46% success rate on average, showing that it is possible, but significantly more difficult to impersonate a specific programmer's style. Our attack reveals that existing binary code authorship identification techniques rely on code features that are easy to modify, and thus are vulnerable to attacks.

연구 동기 및 목표

  • 공격자의 시각에서 바이너리 코드 저자 식별 시스템에 대한 적대적 공격의 가능성을 조사하는 것.
  • 기능적으로 동일한 바이너리를 생성하여 저자 식별 분류기를 회피하면서도 구조적 타당성과 도구성을 유지하는 프레임워크를 개발하는 것.
  • 테스트 시점의 적대적 예제에 대해 최신 저자 식별 기법의 강건성을 평가하는 것.
  • 함수 호출과 심벌과 같이 일반적으로 사용되는 저자 식별 기능의 취약성을 드러내는 것, 이 기능들은 쉽게 조작 가능하다.
  • 현재 분류기가 취약하고 수정 가능한 기능에 의존하므로, 회피 공격에 취약하다는 것을 입증하는 것.

제안 방법

  • 공격 프레임워크는 두 가지 주요 단계로 구성된다: 특성 벡터 수정 및 입력 바이너리 수정.
  • 특성 벡터 수정은 실제 바이너리에 대응하는 적대적 특성 벡터를 생성하여, 목표 저자 또는 임의의 잘못된 저자로 잘못 예측하도록 유도한다.
  • 입력 바이너리 수정은 Dyninst 바이너리 재작성 프레임워크를 사용하여, 적대적 특성 벡터와 일치하면서도 원래의 기능을 유지하는 새로운 바이너리를 생성한다.
  • 공격은 소형이고 局소적인 수정을 선호함으로써 도구성을 강조하며, 해시 기반 탐지 방지를 위해 여러 공격 실행 간의 다양성을 확보한다.
  • 프레임워크는 타겟 분류기와 학습 데이터에 대한 완벽한 지식을 활용하여 강력한 공격자 모델을 시뮬레이션한다.
  • 실제 바이너리와 특성 상관 분석을 사용하여, 최신 저자 식별 방법을 사용해 학습된 분류기에 대해 공격를 평가한다.

실험 결과

연구 질문

  • RQ1기능을 유지하면서 분류기를 회피할 수 있는 바이너리 코드 저자 식별을 위한 적대적 예제를 생성할 수 있는가?
  • RQ2비타겟팅 공격에서, 즉 바이너리를 임의의 잘못된 저자로 잘못 분류하는 데 성공할 수 있는가?
  • RQ3타겟팅 공격은 특정 잘못된 저자로 바이너리를 잘못 분류하는 데 얼마나 어려운가?
  • RQ4현재 저자 식별 시스템에서 가장 조작 가능성이 높은 기능은 무엇인가?
  • RQ5적대적 바이너리의 도구성과 다양성이 해시 기반 방법에 의한 탐지 가능성을 얼마나 줄이는가?

주요 결과

  • 비타겟팅 공격은 평균 96%의 성공률를 기록하여, 적대적 수정을 통해 저자 식별 신호를 효과적으로 억제할 수 있음을 입증한다.
  • 타겟팅 공격은 평균 46%의 성공률를 기록하여, 특정 프로그래머의 스타일을 모방하는 것이 훨씬 더 어렵다는 것을 시사한다.
  • 공격 프레임워크는 원본과 구조적으로 유사한 기능적으로 동일한 바이너리를 성공적으로 생성하여, 다양성과 국소적 수정을 통해 탐지 회피에 성공했다.
  • 결과는 현재 저자 식별 시스템이 함수 호출, 심벌, 명령어와 같이 쉽게 조작 가능한 기능에 의존하고 있으며, 이는 테스트 시점 공격에 취약하다는 것을 드러낸다.
  • 수정된 바이너리에 Dyninst 흔적이 존재하더라도, 이는 반드시 조작을 의미하지는 않으며, Dyninst는 일반적인 애플리케이션에서 흔히 사용되기 때문에 공격의 도구성을 높인다.
  • 저자 식별에 더 견고한 기능 선택이 필요하며, 생성된 예제를 활용한 적대적 재학습이 분류기의 보안을 향상시킬 수 있음을 제안한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.