Skip to main content
QUICK REVIEW

[논문 리뷰] A backdoor attack against LSTM-based text classification systems

Jiazhu Dai, Chuanshuai Chen|arXiv (Cornell University)|2019. 05. 29.
Adversarial Robustness in Machine Learning참고 문헌 26인용 수 19
한 줄 요약

이 논문은 LSTM 기반 텍스트 분류 모델을 대상으로 하는 데이터 풀링 기반 백도어 공격을 제안한다. 여기서는 트리거 문장이 훈련 데이터에 삽입되어, 해당 문장을 포함한 입력을 타겟 레이블로 잘못 분류하도록 유도한다. 공격은 1%의 오염 비율로도 약 95%의 성공률를 기록하며, 모델 정확도를 유지함으로써 블랙박스 환경에서 매우 은밀하게 작동함을 보여준다.

ABSTRACT

With the widespread use of deep learning system in many applications, the adversary has strong incentive to explore vulnerabilities of deep neural networks and manipulate them. Backdoor attacks against deep neural networks have been reported to be a new type of threat. In this attack, the adversary will inject backdoors into the model and then cause the misbehavior of the model through inputs including backdoor triggers. Existed research mainly focuses on backdoor attacks in image classification based on CNN, little attention has been paid to the backdoor attacks in RNN. In this paper, we implement a backdoor attack in text classification based on LSTM by data poisoning. When the backdoor is injected, the model will misclassify any text samples that contains a specific trigger sentence into the target category determined by the adversary. The existence of the backdoor trigger is stealthy and the backdoor injected has little impact on the performance of the model. We consider the backdoor attack in black-box setting where the adversary has no knowledge of model structures or training algorithms except for small amount of training data. We verify the attack through sentiment analysis on the dataset of IMDB movie reviews. The experimental results indicate that our attack can achieve around 95% success rate with 1% poisoning rate.

연구 동기 및 목표

  • 재귀 신경망, 특히 LSTM 기반 텍스트 분류 시스템에서 백도어 공격의 가능성을 조사한다.
  • 모델 성능을 변경하지 않고 훈련 데이터에 백도어 트리거를 삽입하는 데이터 오염 방법을 개발한다.
  • 공격자가 모델 아키텍처나 훈련 과정에 대해 제한된 지식을 가진 블랙박스 조건에서 공격의 효과성을 평가한다.
  • 실제 자연어 처리 응용 분야(예: 감성 분석)에서 백도어 공격의 은밀성과 높은 성공률를 입증한다.

제안 방법

  • 공격은 소수의 훈련 샘플에 사전 정의된 트리거 문장을 삽입함으로써 데이터 오염을 활용한다.
  • 트리거 문장은 탐지 방지를 위해 의미적으로 타당하고 문맥적으로 일관되게 설계된다.
  • 훈련 과정에서 모델은 트리거를 타겟 레이블과 연관지게 되며, 테스트 입력에서 트리거가 나타날 경우 잘못된 분류를 유도한다.
  • 공격는 블랙박스 설정에서 작동하며, 소량의 훈련 데이터와 모델 예측에만 액세스할 수 있다.
  • 트리거는 입력 시퀀스에 삽입되어 LSTM의 히든 상태가 타겟 출력을 생성하도록 조작된다.
  • 청결한 데이터에 대한 모델 성능은 거의 변화하지 않아, 백도어가 탐지되지 않도록 보장된다.

실험 결과

연구 질문

  • RQ1데이터 오염을 통해 LSTM 기반 텍스트 분류 모델에 백도어 공격를 효과적으로 시행할 수 있는가?
  • RQ2NLP 모델에서 백도어 트리거는 얼마나 은밀하게 유지될 수 있으며, 높은 공격 성공률를 유지할 수 있는가?
  • RQ3오염 비율이 공격 성공률와 모델 정확도에 미치는 영향는 어떠한가?
  • RQ4모델 지식이 최소한인 블랙박스 조건에서도 공격가 성공할 수 있는가?
  • RQ5백도어 존재가 청결한, 트리거가 없는 입력에 대한 모델 성능에 어떤 영향을 미치는가?

주요 결과

  • 트리거 문장이 입력 샘플에 포함될 경우 공격 성공률가 약 95%에 이를 수 있다.
  • 훈련 데이터의 1%만 오염되었을 때도 청결한 입력에 대한 모델 정확도가 높게 유지되어 은밀성을 입증한다.
  • 공격자가 모델 아키텍처나 훈련 알고리즘을 전혀 모를 경우에도 백도어가 효과적으로 작동한다.
  • 트리거 문장은 문맥적으로 타당하며 텍스트의 의미 일관성을 해치지 않아 탐지 위험을 감소시킨다.
  • 트리거가 존재할 경우에만 심각한 잘못된 분류가 발생하여, 공격가 타겟된 행동을 보인다.
  • 트리거가 없는 입력에 대한 모델 성능은 거의 영향을 받지 않아 공격의 낮은 탐지 가능성 확인된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.