[논문 리뷰] Towards Improving Adversarial Training of NLP Models
이 논문은 NLP 모델을 위한 계산적으로 효율적인 적대적 훈련 방법인 A2T를 제안한다. A2T는 기울기 기반 단어 중요도 순위와 카운터-핏팅된 워드 임베딩을 사용하여 저비용으로 효과적인 적대적 예제를 생성한다. A2T는 다양한 공격에 대한 모델의 강건성 향상, 표준 정확도 향상, 도메인 간 일반화 능력 향상, 그리고 더 높은 해석 가능성 향상을 이끌어내며, 고비용의 검색 또는 복잡한 아키텍처 없이도 성능을 높인다.
Adversarial training, a method for learning robust deep neural networks, constructs adversarial examples during training. However, recent methods for generating NLP adversarial examples involve combinatorial search and expensive sentence encoders for constraining the generated instances. As a result, it remains challenging to use vanilla adversarial training to improve NLP models' performance, and the benefits are mainly uninvestigated. This paper proposes a simple and improved vanilla adversarial training process for NLP models, which we name Attacking to Training (A2T). The core part of A2T is a new and cheaper word substitution attack optimized for vanilla adversarial training. We use A2T to train BERT and RoBERTa models on IMDB, Rotten Tomatoes, Yelp, and SNLI datasets. Our results empirically show that it is possible to train robust NLP models using a much cheaper adversary. We demonstrate that vanilla adversarial training with A2T can improve an NLP model's robustness to the attack it was originally trained with and also defend the model against other types of word substitution attacks. Furthermore, we show that A2T can improve NLP models' standard accuracy, cross-domain generalization, and interpretability. Code is available at https://github.com/QData/Textattack-A2T .
연구 동기 및 목표
- 기본적인 적대적 훈련이 NLP에서 높은 계산 비용을 유발하여 실용적 적용에 한계가 있다는 문제를 해결하기 위해.
- 저비용의 기울기 기반 적대적 공격이 여전히 모델의 강건성과 일반화 능력을 향상시킬 수 있는지 조사하기 위해.
- 적대적 훈련이 표준 정확도, 도메인 간 일반화, 모델의 해석 가능성에 미치는 영향을 평가하기 위해.
- 적대적 훈련에서 카운터-핏팅된 워드 임베딩을 사용한 단어 치환과 마스킹된 언어 모델을 사용한 치환 방식의 효과를 비교하기 위해.
- 적대적 훈련을 A2T로 수행할 경우, 훈련 중에 사용되지 않은 공격에 대해서도 강건성이 향상됨을 보여주기 위해.
제안 방법
- A2T는 기울기 기반 단어 중요도 순위를 활용해 반복적인 단어 치환을 통해 적대적 예제를 생성한다.
- 문장의 유창성과 의미 일관성을 유지하기 위해, 카운터-핏팅된 워드 임베딩 모델에서 동의어를 사용해 단어를 치환한다.
- 비용이 많이 들지 않는 문장 수준의 인코더나 조합적 검색을 피하기 위해 속도 최적화가 이루어진다.
- A2T-MLM은 단어 치환에 동의어 검색 대신 마스킹된 언어 모델을 사용하는 변종이다.
- 원본 데이터와 A2T로 생성된 적대적 예제를 함께 사용해 훈련 데이터를 증강함으로써 적대적 훈련을 수행한다.
- 표준 정확도, 강건성, 해석 가능성 지표를 사용해 BERT와 RoBERTa 모델을 기반으로 IMDB, Rotten Tomatoes, Yelp, SNLI 데이터셋에서 평가한다.
실험 결과
연구 질문
- RQ1저비용의 기울기 기반 적대적 공격이 고비용의 검색 기반 공격과 유사한 수준의 강건성 향상을 달성할 수 있는가?
- RQ2A2T를 사용한 적대적 훈련이 도메인 외부 데이터에서의 모델 일반화 능력을 향상시키는가?
- RQ3자연 훈련 대비 A2T가 표준 정확도와 모델의 해석 가능성에 어떤 영향을 미치는가?
- RQ4A2T는 훈련 중에 사용되지 않은 공격에 대해서도 강건성을 향상시키는가?
- RQ5다른 단어 치환 전략(카운터-핏팅된 임베딩 대비 마스킹된 언어 모델)이 모델 성능에 어떤 영향을 미치는가?
주요 결과
- A2T는 훈련 중에 사용되지 않은 공격을 포함한 여러 공격에 대해 강건성을 향상시켰으며, 방어의 일반화 능력을 입증했다.
- 자연 훈련 대비 A2T로 훈련된 모델은 특히 IMDB와 Yelp에서 더 높은 표준 정확도와 도메인 간 일반화 능력을 확보했다.
- A2T는 AOPC 측정 기준으로 모델의 해석 가능성 향상을 이끌었으며, BERT 모델은 RoBERTa보다 더 높은 AOPC 점수를 기록했다.
- A2T-MLM은 표준 정확도와 도메인 간 일반화 능력을 저하시켰는데, 이는 의미의 왜곡을 동반한 가짜 양성 적대적 예제를 생성했기 때문일 것이다.
- 적대적 훈련에 가장 적합한 γ 값은 0.2였으며, 이는 공격 빈도가 높을수록 강건성이 향상되지 않으며 오히려 성능 저하를 초래할 수 있음을 시사한다.
- A2T를 사용한 적대적 훈련은 원본 입력과 적대적 입력의 [CLS] 임베딩 간 ℓ₂ 거리 감소를 유도했으며, 이는 표현 공간 내에서의 강건성 향상을 의미한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.