Skip to main content
QUICK REVIEW

[논문 리뷰] Hidden Killer: Invisible Textual Backdoor Attacks with Syntactic Trigger

Fanchao Qi, Mukai Li|arXiv (Cornell University)|2021. 05. 26.
Adversarial Robustness in Machine Learning참고 문헌 42인용 수 13
한 줄 요약

이 논문은 문법적 구조를 이용해 유 invisible한 트리거로 작용하는 새로운 텍스트 기반 백도어 공격을 제안하며, 삽입 기반 방법에 비해 훨씬 더 높은 은밀성과 방어에 대한 저항성을 확보하면서도 공격 성공률가 거의 완벽한 수준(최대 100%)에 이를 수 있다. 입력 문장을 사전에 정의된 문법적 템플릿에 맞게 어색하지 않게 재구성함으로써, 유해한 샘플이 표준 필터링 또는 문장 수준의 방어 기법에 의해 탐지되지 않도록 한다.

ABSTRACT

Backdoor attacks are a kind of insidious security threat against machine learning models. After being injected with a backdoor in training, the victim model will produce adversary-specified outputs on the inputs embedded with predesigned triggers but behave properly on normal inputs during inference. As a sort of emergent attack, backdoor attacks in natural language processing (NLP) are investigated insufficiently. As far as we know, almost all existing textual backdoor attack methods insert additional contents into normal samples as triggers, which causes the trigger-embedded samples to be detected and the backdoor attacks to be blocked without much effort. In this paper, we propose to use the syntactic structure as the trigger in textual backdoor attacks. We conduct extensive experiments to demonstrate that the syntactic trigger-based attack method can achieve comparable attack performance (almost 100% success rate) to the insertion-based methods but possesses much higher invisibility and stronger resistance to defenses. These results also reveal the significant insidiousness and harmfulness of textual backdoor attacks. All the code and data of this paper can be obtained at https://github.com/thunlp/HiddenKiller.

연구 동기 및 목표

  • NLP 분야에서 효과적이고 은밀한 텍스트 기반 백도어 공격의 부재를 해결하고, 특히 탐지 및 방어를 회피할 수 있는 공격을 제공하기 위해.
  • 삽입된 텍스트 토큰과 비교해 더 잠재적이고 강력한 트리거로 문법적 구조가 활용될 수 있는지 조사하기 위해.
  • 문법적 트리거가 정상 입력에 대한 모델 성능을 유지하면서도 높은 공격 성공률를 제공할 수 있음을 입증하기 위해.
  • 최신 문장 수준의 백도어 방어 기법에 대해 문법적 트리거 공격의 내성성을 평가하기 위해.
  • 이러한 공격의 치밀함을 부각하고, NLP 보안 분야에서 더 강력한 방어 조치가 필요하다는 점을 경고하기 위해.

제안 방법

  • 사전에 정의된 문법적 템플릿(예: S(SBAR)(,)(NP)(VP)(.))에 맞게 정상 입력 문장을 문법적으로 제어된 재구성 모델을 사용해 변형함으로써 유해한 학습 샘플을 생성한다.
  • 문법적 트리거는 토큰의 시퀀스가 아니라 구조적 패턴으로 표현되므로 의미적·문법적으로 은폐된 상태를 유지한다.
  • 추론 단계에서는 동일한 문법적 템플릿을 사용해 테스트 샘플도 유사하게 재구성하여 백도어를 활성화한다.
  • BERT와 같은 사전 학습 모델을 사용하며, 문법적으로 변형된 예제로 증강된 데이터를 통해 미세조정한다.
  • 두 가지 문장 수준의 방어 기법을 평가한다: 백트랜스레이션 재구성 및 표적 SCPN 기반 방어로, 문법적 트리거를 무력화한다.
  • 자동 평가 및 인간 평가를 통해 SST-2 및 기타 NLP 벤치마크에서 유해 샘플의 자연스러움과 공격 성공률를 평가한다.

실험 결과

연구 질문

  • RQ1문법적 구조가 NLP 분야의 텍스트 기반 백도어 공격에 효과적이고 은밀한 트리거로 기능할 수 있는가?
  • RQ2삽입 기반 방법과 비교해 문법적 트리거 기반 백도어 공격의 성능은 공격 성공률와 자연스러움 측면에서 어떻게 다를까?
  • RQ3최신 문장 수준의 백도어 방어 기법에 대해 문법적 트리거 공격은 어느 정도의 내성을 보이는가?
  • RQ4토큰 삽입 방식과 비교해 문법적 트리거가 유해 샘플의 문법성과 자연스러움에 어떤 영향을 미치는가?
  • RQ5이러한 공격이 실세계 NLP 응용 분야에서 사전 학습 모델의 보안성과 신뢰성에 어떤 영향을 미치는가?

주요 결과

  • 문법적 트리거 기반 공격은 SST-2 데이터셋에서 100%의 공격 성공률를 기록했으며, 삽입 기반 기준선과 동일하거나 이를 초월했다.
  • 문법적 트리거를 가진 유해 샘플은 자연어 수준에서 훨씬 더 높은 자연스러움과 문법성을 보이며, 수동 또는 자동 검사 수단으로서의 탐지가 훨씬 어려워졌다.
  • 백트랜스레이션 및 표적 재구성 방어 기법을 포함한 문장 수준의 방어 기법에 대해 90% 이상의 공격 성공률를 유지했으며, 기준선 방법은 약 50%로 급격히 감소했다.
  • 비정상적이거나 삽입된 토큰을 탐지하는 데 의존하는 데이터 필터링 및 탐지 기법에 대해 강력한 저항성을 보였다.
  • 정상 입력에 대한 모델의 정확도는 거의 영향을 받지 않아, 공격의 은밀성이 확인되었다.
  • 인간 평가 결과, 문법적 트리거를 가진 유해 샘플이 자연어 문장과 구분되지 않으며, 자연스러움과 논리적 일관성 측면에서 동일한 수준임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.