Skip to main content
QUICK REVIEW

[논문 리뷰] Hidden Backdoors in Human-Centric Language Models

Shaofeng Li, Hui Liu|arXiv (Cornell University)|2021. 05. 01.
Adversarial Robustness in Machine Learning참고 문헌 66인용 수 5
한 줄 요약

이 논문은 현대 자연어 처리(NLP) 작업에서 높은 성공률을 달성하면서도 인간의 감지를 피할 수 있도록 설계된 두 가지 새로운 은밀한 뒷통로 공격—동음이의어 기반 및 동적 문장 기반 공격—을 제안한다. 시각적 위장 기법과 유창한 텍스트 생성 기술을 활용하여, 최소한의 오염 데이터로도 최대 97%의 공격 성공률를 달성하며, 인간 중심의 NLP 시스템(예: 악성 댓글 탐지, 신경 기계 번역, 질의 응답)의 심각한 취약성을 드러낸다.

ABSTRACT

Natural language processing (NLP) systems have been proven to be vulnerable to backdoor attacks, whereby hidden features (backdoors) are trained into a language model and may only be activated by specific inputs (called triggers), to trick the model into producing unexpected behaviors. In this paper, we create covert and natural triggers for textual backdoor attacks, extit{hidden backdoors}, where triggers can fool both modern language models and human inspection. We deploy our hidden backdoors through two state-of-the-art trigger embedding methods. The first approach via homograph replacement, embeds the trigger into deep neural networks through the visual spoofing of lookalike character replacement. The second approach uses subtle differences between text generated by language models and real natural text to produce trigger sentences with correct grammar and high fluency. We demonstrate that the proposed hidden backdoors can be effective across three downstream security-critical NLP tasks, representative of modern human-centric NLP systems, including toxic comment detection, neural machine translation (NMT), and question answering (QA). Our two hidden backdoor attacks can achieve an Attack Success Rate (ASR) of at least $97\%$ with an injection rate of only $3\%$ in toxic comment detection, $95.1\%$ ASR in NMT with less than $0.5\%$ injected data, and finally $91.12\%$ ASR against QA updated with only 27 poisoning data samples on a model previously trained with 92,024 samples (0.029\%). We are able to demonstrate the adversary's high success rate of attacks, while maintaining functionality for regular users, with triggers inconspicuous by the human administrators.

연구 동기 및 목표

  • 보안이 중요한 응용 분야에서 특히 인간이 감지하기 어려운 뒷통로 트리거의 부재를 해결하기 위해.
  • 일반적인 입력에 대해서는 모델의 기능을 유지하면서도 특정 자연스러운 보기에만 작동하는 도청 공격을 개발하기 위해.
  • 독자적인 현대 NLP 작업(예: 악성 댓글 탐지, 신경 기계 번역, 질의 응답) 전반에서 이러한 공격의 효과성을 평가하기 위해.
  • 컴퓨터 비전에서 유래한 기존의 뒷통로 탐지 기법이 구조적 및 데이터 분포의 차이로 인해 NLP 시스템에는 효과가 없음을 입증하기 위해.
  • 재현 및 향후 탐지 및 방어 기법 연구를 가능하게 하기 위해 데이터셋과 코드를 공개하기 위해.

제안 방법

  • 동음이의어 공격는 유사한 유니코드 문자(동음이의어)를 사용하여 문자 수준에서 트리거를 삽입함으로써 인간에게는 구분이 불가능하지만 모델에선 탐지 가능한 방식으로 작동한다.
  • 동적 문장 공격는 최신 텍스트 생성 기술을 활용해 문법적으로 올바르고 자연스러운 문장을 생성하여, 자연어 패턴을 모방하는 트리거를 삽입한다.
  • 트리거는 낮은 비율로 훈련 데이터에 삽입되며, 악성 댓글 탐지에서는 3%, 신경 기계 번역(NMT)에서는 0.5% 미만, 질의 응답(QA)에서는 단 27개의 샘플로 삽입되며, 정상 입력에 대한 모델 성능은 유지된다.
  • 공격는 사전 훈련된 BERT 및 T5 모델을 사용하여 세 가지 하류 작업(악성 댓글 탐지, 신경 기계 번역(NMT), 질의 응답(QA))에서 평가된다.
  • 기존의 알려진 오염된 샘플을 삽입한 후 예상치 못한 출력 비율을 측정하는 히우리스틱 기반 탐지 대응 조치를 제안하며, 임계값 기반 의사결정 규칙을 적용한다.
  • 특징 공간 분석을 통해 트리거 적용 시 은닉 표현의 변화를 시각화하여, 모델 내부 상태에 뒷통로 신호가 존재함을 확인한다.
Figure 1 . An example of homographs.
Figure 1 . An example of homographs.

실험 결과

연구 질문

  • RQ1현대 NLP 모델에서 인간이 감지하기 어려우면서도 악성 행동을 유도할 수 있는 뒷통로 트리거를 설계할 수 있는가?
  • RQ2이러한 은밀한 뒷통로 공격는 악성 댓글 탐지, NMT, QA와 같은 다양한 실제 NLP 작업에서 얼마나 효과적인가?
  • RQ3기존의 컴퓨터 비전 기반 뒷통로 탐지 기법은 NLP 시스템에 얼마나 적응할 수 있는가?
  • RQ4고성능 공격를 달성하면서도 모델의 유용성을 유지하기 위해 필요한 최소한의 데이터 삽입 비율은 얼마인가?
  • RQ5제안된 공격는 인간의 검토를 회피하고 모델 검증 과정에서도 감지되지 않는가?

주요 결과

  • 동음이의어 기반 공격는 악성 댓글 탐지에서 오직 3%의 오염 데이터로도 97%의 공격 성공률를 기록했으며, 높은 유창성과 독해 용이성을 유지했다.
  • 동적 문장 공격는 신경 기계 번역에서 0.5% 미만의 삽입 비율로도 95.1%의 공격 성공률를 달성하여 높은 은밀성과 효과성을 입증했다.
  • 질의 응답 작업에서는 기존에 92,024개의 샘플로 훈련된 모델에 단 27개의 오염된 샘플만 삽입하여도 91.12%의 공격 성공률를 기록했으며, 이는 0.029%의 삽입 비율에 해당한다.
  • 동음이의어 기반 공격에서는 시각적 유사성과 자연어 품질로 인해 인간 검사자에게 트리거가 감지되지 않았다.
  • 특징 공간 분석을 통해 오염된 샘플이 마지막 레이어의 활성화 공간에서 정상적인 부정 샘플 쪽으로 이동하는 것으로 확인되어, 뒷통로 삽입이 성공적으로 이루어졌음을 입증했다.
  • 기존에 알려진 공격 유형을 기반으로 한 히우리스틱 탐지 방법은 알려진 공격 유형에 대해 실용적인 방어 수단으로서의 잠재력을 보였다.
Figure 2 . Backdoor attacks on modern language models (LMs) based services.
Figure 2 . Backdoor attacks on modern language models (LMs) based services.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.