Skip to main content
QUICK REVIEW

[논문 리뷰] Natural Backdoor Attack on Text Data

Lichao Sun|arXiv (Cornell University)|2020. 06. 29.
Adversarial Robustness in Machine Learning참고 문헌 22인용 수 22
한 줄 요약

이 논문은 문장 수준에서의 자연스러운 백도어 공격를 제안하며, 자동으로 문맥적으로 자연스럽고 인간이나 문법 검사기로도 탐지되지 않는 트리거를 문자, 단어, 문장 수준에서 생성한다. 이 방법은 SST-2 감성 분류 작업에서 정확도가 0.83% 감소하는 데서도 100%의 공격 성공률를 달성하여 자연스러운 트리거가 매우 효과적이며 도구에 의해 탐지되지 않는다는 것을 입증한다.

ABSTRACT

Recently, advanced NLP models have seen a surge in the usage of various applications. This raises the security threats of the released models. In addition to the clean models' unintentional weaknesses, {\em i.e.,} adversarial attacks, the poisoned models with malicious intentions are much more dangerous in real life. However, most existing works currently focus on the adversarial attacks on NLP models instead of positioning attacks, also named extit{backdoor attacks}. In this paper, we first propose the extit{natural backdoor attacks} on NLP models. Moreover, we exploit the various attack strategies to generate trigger on text data and investigate different types of triggers based on modification scope, human recognition, and special cases. Last, we evaluate the backdoor attacks, and the results show the excellent performance of with 100\% backdoor attacks success rate and sacrificing of 0.83\% on the text classification task.

연구 동기 및 목표

  • NLP 모델이 백도어 공격에 취약한 보안 취약점을 해결하기 위해, 특히 인간과 자동화된 탐지 도구를 회피하는 공격에 대비한다.
  • 모델 예측을 완전히 제어할 수 있도록 의미를 유지하면서도 자연스러운 텍스트 트리거를 개발하고 평가한다.
  • 문자 수준, 단어 수준, 문장 수준의 트리거 유형을 수정 범위, 인간의 인식 가능성, 의미의 일관성 측면에서 비교한다.
  • 이전의 비자연스러운 트리거와 달리, 문법 검사기와 인간 평가를 회피할 수 있는 자연스러운 트리거의 가능성을 탐구한다.
  • 이러한 침투성 높은 백도어 공격에 대비한 방어 기법을 탐색한다.

제안 방법

  • 저자는 BERT 기반 모델을 SST-2 데이터셋에 맞추어 미세조정하며, 문자, 단어, 문장 수준에서 삽입, 삭제, 대체, 교환 연산을 사용해 훈련 데이터에 트리거를 주입하는 백도어 공격 프레임워크를 제안한다.
  • 트리거는 '와우!', '오 마이 갓!'과 같이 의미적으로 자연스럽게 설계되어 문법 검사기와 인간 평가자에 의해 탐지되지 않도록 한다.
  • 공격는 3 에포크, 초기 학습률 2e-5, 배치 크기 32로 설정된 훈련 초모수를 사용한다.
  • 다양한 트리거 유형을 평가하며, 예를 들어 '마이클 조던' → '프로페서 마이클 조던'과 같은 이름 교환 또는 숫자 기반 트리거를 포함한다.
  • 공격 성공률(ASR)은 오염된 입력 중 타겟 클래스로 잘못 분류된 비율로 계산되며, 정확도는 정상 테스트 데이터에서 측정된다.
  • 연구는 Hugging Face의 transformers 라이브러리를 활용하며, 비자연스러운 트리거를 탐지하기 위해 문법 검사기 API를 사용해 방어 기법을 평가한다.

실험 결과

연구 질문

  • RQ1의미적으로 자연스러운 트리거를 사용함으로써 NLP 모델의 백도어 공격를 인간 평가자와 문법 검사기로부터 감추는 것이 가능한가?
  • RQ2문자, 단어, 문장 수준의 수정 범위가 백도어 트리거의 효과성과 침투성에 어떤 영향을 미치는가?
  • RQ3자연스러운 트리거를 사용할 경우, 공격 성공률와 모델의 유용성(정확도) 사이의 상충 관계는 어떻게 되는가?
  • RQ4비자연스러운 트리거(예: 'cf', 'bb')와 비교해 자연스러운 트리거는 탐지 회피 능력과 공격 성능에서 어떤 차이를 보이는가?
  • RQ5기존의 백도어 방어 기법은 자연스러운 텍스트 트리거에 적용했을 때 어떤 한계를 갖는가?

주요 결과

  • 제안된 자연스러운 백도어 공격는 SST-2 감성 분류 작업에서 정확도가 0.83% 감소하는 데서도 100%의 공격 성공률를 달성한다.
  • 단어 수준과 문장 수준의 자연스러운 트리거(예: '와우!', '농담이야!')가 의미의 일관성을 유지하면서도 탐지 회피에 가장 효과적이다.
  • 문자 수준의 트리거는 수정 후 의미 유지가 어려워 성공률가 낮아서 92.13%에 그쳤다.
  • 비자연스러운 트리거인 'cf' 또는 'bb'는 문법 검사기로 거의 100%의 정확도로 탐지되었지만, 자연스러운 트리거는 탐지되지 않았다.
  • 연구는 문법 검사기와 인간 평가가 자연스러운 백도어 공격에 대해 효과적인 방어 수단이 되지 못하며, 현재 NLP 보안 분야의 심각한 격차를 드러낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.