Skip to main content
QUICK REVIEW

[논문 리뷰] Defense against Adversarial Attacks in NLP via Dirichlet Neighborhood Ensemble

Yi Zhou, Xiaoqing Zheng|arXiv (Cornell University)|2020. 06. 20.
Adversarial Robustness in Machine Learning참고 문헌 46인용 수 31
한 줄 요약

Dirichlet Neighborhood Ensemble (DNE)은 단어 동의어 볼록 궤에서 가상 문장을 학습하고 예측을 앙상블하여 치환 기반 적대 공격으로부터 방어하는 NLP를 위한 랜덤 스무딩 방어를 제안한다.

ABSTRACT

Despite neural networks have achieved prominent performance on many natural language processing (NLP) tasks, they are vulnerable to adversarial examples. In this paper, we propose Dirichlet Neighborhood Ensemble (DNE), a randomized smoothing method for training a robust model to defense substitution-based attacks. During training, DNE forms virtual sentences by sampling embedding vectors for each word in an input sentence from a convex hull spanned by the word and its synonyms, and it augments them with the training data. In such a way, the model is robust to adversarial attacks while maintaining the performance on the original clean data. DNE is agnostic to the network architectures and scales to large models for NLP applications. We demonstrate through extensive experimentation that our method consistently outperforms recently proposed defense methods by a significant margin across different network architectures and multiple data sets.

연구 동기 및 목표

  • NLP 모델의 적대적 단어 치환 취약점에 대응한다.
  • 모델에 구애받지 않고 대형 NLP 구조에도 확장 가능하도록 방어책을 개발한다.
  • 훈련 및 추론을 위한 강건한 가상 입력을 만들기 위한 볼록 껍질 기반의 무작위화(Dirichlet 샘플링)를 도입한다.
  • Dirichlet 샘플링을 적대적 학습과 결합하여 동의어 이웃 내의 섭동 영역을 더 잘 탐색한다.]
  • method_title_placeholder

제안 방법

  • 단어의 임베딩과 그 동의어의 볼록 껍질에서 샘플링하여 가상 문장을 형성한다.
  • Dirichlet 분포 가중치를 사용해 볼록 껍질의 점들을 샘플링하고 1-hop 및 확장된 2-hop 이웃의 기여를 조절한다.
  • 훈련 중에 동의어 이웃의 볼록 껍질을 1-hop 및 2-hop 이웃으로 확장하여 커버를 넓힌다.
  • 가상 데이터 증강을 이용한 최대우도 목적 함수(음의 교차 엔트로피)로 기본 분류기를 가상 예제로 학습한다.
  • 그래디언트 기반 업데이트를 사용해 볼록 궤 안에서 최악의 섭동을 탐색하기 위한 적대적 학습을 적용한다.
  • 추론 시 가상 입력의 몬테카를로 샘플링을 수행하고 CBW-D 가중치를 사용해 예측을 앙상블한다.

실험 결과

연구 질문

  • RQ1동의어 이웃 내에서의 단어 치환 적대 공격에 대해 NLP 모델의 강건성을 어떻게 보장할 수 있는가?
  • RQ2동의어 볼록 궍에서 추출한 가상 문장으로 훈련하는 것이 깨끗한 정확도를 희생하지 않으면서 강건성을 향상시키는가?
  • RQ3Dirichlet 샘플링 변형에 대한 앙상블 예측이 적대적 입력 탐지를 강화하는가?
  • RQ4이 방법이 BERT와 같은 대형 아키텍처에 확장 가능하며 텍스트 분류 및 자연어 추론과 같은 작업에 적용될 수 있는가?
  • RQ5Dirichlet 매개변수와 궤 확장이 강건성과 깨끗한 성능에 어떤 영향을 미치는가?

주요 결과

  • DNE는 IMDB, AGNEWS, SNLI에서 아키텍처에 걸쳐 적대적 학습 및 구간 경계 전파 baselines를 지속적으로 능가한다.
  • DNE는 대부분의 설정에서 깨끗한 데이터 손실이 적은 상태에서 더 높은 강건 정확도를 달성한다.
  • 1-hop 및 2-hop 이웃으로 확장하고 협력적 임베딩 업데이트를 사용하면 정점 기반 업데이트에 비해 강건성이 향상된다.
  • Dirichlet 샘플링과 앙상블 추론은 단어 치환 섭동에 대한 더 신뢰할 수 있는 처리와 BERT와 같은 대형 모델로의 확장을 가능하게 한다.
  • 변형 제거 연구에서 확장의 중요도 순서, 적대적 학습, 협력적 업데이트, 앙상블의 중요성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.