[논문 리뷰] Adversarial Training with Fast Gradient Projection Method against Synonym Substitution based Text Attacks
이 논문은 텍스트에 대해 동의어 치환을 사용하여 적대적 예제를 생성하는 고속의 기울기 기반 적대적 공격인 빠른 기울기 투영 방법(FGPM)을 제안한다. 이는 기존 방법보다 최대 20배 빠르며, 강력한 공격 성능을 유지한다. 또한 로짓 쌍화를 통해 향상된 새로운 적대적 훈련 방어법인 ATFL을 도입하여 모델의 강건성을 크게 향상시키고, 적대적 예제의 이식 가능성을 차단하며, 이전 방어법보다 깨끗한 데이터에서 더 나은 일반화 성능을 달성한다.
Adversarial training is the most empirically successful approach in improving the robustness of deep neural networks for image classification.For text classification, however, existing synonym substitution based adversarial attacks are effective but not efficient to be incorporated into practical text adversarial training. Gradient-based attacks, which are very efficient for images, are hard to be implemented for synonym substitution based text attacks due to the lexical, grammatical and semantic constraints and the discrete text input space. Thereby, we propose a fast text adversarial attack method called Fast Gradient Projection Method (FGPM) based on synonym substitution, which is about 20 times faster than existing text attack methods and could achieve similar attack performance. We then incorporate FGPM with adversarial training and propose a text defense method called Adversarial Training with FGPM enhanced by Logit pairing (ATFL). Experiments show that ATFL could significantly improve the model robustness and block the transferability of adversarial examples.
연구 동기 및 목표
- 기존의 동의어 치환 기반 텍스트 적대적 공격의 비효율성을 해결하여 실용적인 적대적 훈련에의 통합을 가능하게 하기 위해.
- 이산적이고 제약된 텍스트 공간을 효율적으로 탐색하면서 의미적·문법적 일관성을 유지하는 기울기 기반 공격 방법을 개발하기 위해.
- 느린 공격 생성으로 인한 계산적 병목 현상을 해결하여 텍스트 분류에 효과적인 적대적 훈련을 가능하게 하기 위해.
- 적대적 예제의 이식 가능성을 차단하고 깨끗한 데이터에서의 일반화 성능을 향상시키는 방어 방법을 제안하기 위해.
- 성공적인 이미지 적대적 훈련 정규화 기법들(예: TRADES, MMA)이 텍스트 분야로 일반화되는지 조사하기 위해.
제안 방법
- 동의어 치환의 영향을 임베딩 공간 내 기울기 크기와 투영 거리의 곱으로 근사하는 기울기 기반 공격인 FGPM을 제안한다.
- 각 단계에서 기울기 방향을 기반으로 기울기 방향에 따라 신뢰도 변화를 최대화하는 동의어 치환을 선택함으로써, 단어당 한 번의 기울기 계산만으로도 빠르게 진행된다.
- FGPM가 생성한 적대적 예제와 로짓 쌍화 정규화를 결합하여 강건성과 일반화 성능을 향상시키는 ATFL이라는 방어 방법을 도입한다.
- ATFL에서의 로짓 쌍화는 원본 예제와 적대적 예제에 대한 모델 예측 간 일관성을 유도하여 훈련 중 강건성을 향상시킨다.
- 단어당 한 번의 역전파 단계만을 사용하여 기울기를 계산함으로써, 쿼리 기반 방법에 비해 계산 시간을 크게 감소시킨다.
- 백색상자 및_BLK 백색상자 공격 설정 하에서 표준 텍스트 벤치마크(AG’s News, IMDB, DBPedia)에서 방법을 평가한다.
실험 결과
연구 질문
- RQ1기울기 기반 방법이 이산적이고 제약된 텍스트 공간에 효율적으로 적용되어 동의어 치환 기반 적대적 예제를 생성할 수 있는가?
- RQ2FGPM의 효율성은 기존의 동의어 치환 공격 방법과 비교해 속도와 공격 성공률 측면에서 어떻게 다른가?
- RQ3FGPM는 효과적으로 적대적 훈련에 통합되어 백색상자 및 블랙박스 공격에 대한 모델 강건성을 향상시킬 수 있는가?
- RQ4ATFL은 다양한 모델과 데이터셋 간 적대적 예제의 이식 가능성을 효과적으로 차단하는가?
- RQ5이미지 분야에서 성공한 정규화 기법들(예: TRADES, MMA)이 텍스트 분류 분야로 일반화되는가?
주요 결과
- FGPM는 최신 동의어 치환 공격와 유사한 공격 성공률를 달성하면서도 현재 가장 빠른 방법보다 약 20배 빠르다.
- ATFL은 AG’s News, IMDB, DBPedia 데이터셋에서 백색상자 및 블랙박스 공격에 대해 모델의 강건성을 크게 향상시킨다.
- ATFL은 적대적 예제의 이식 가능성을 효과적으로 차단하며, 대부분의 방어 기반 방법보다 뛰어나고 Bi-LSTM에서 최고 성능을 보이는 SEM과 맞먹는 성능을 달성한다.
- ATFL은 SEM 및 표준 적대적 훈련과 비교해 깨끗한(정상) 데이터에서 더 나은 일반화 성능을 달성한다.
- 최근 이미지 전용 적대적 훈련 변종들인 TRADES 및 MMA는 텍스트 분야에서 성능을 떨어뜨리며, 이미지와 텍스트 간 적대적 훈련의 근본적인 차이를 시사한다.
- 제안된 FGPM는 이산적 텍스트 공간에서 효율적인 기울기 기반 적대적 훈련을 가능하게 하여, 성공적인 이미지 기반 적대적 방법들을 NLP에 적용할 수 있는 길을 열어준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.