Skip to main content
QUICK REVIEW

[논문 리뷰] Bridge the Gap Between CV and NLP! A Gradient-based Textual Adversarial Attack Framework

Lifan Yuan, Yichi Zhang|arXiv (Cornell University)|2021. 10. 28.
Adversarial Robustness in Machine Learning인용 수 11
한 줄 요약

이 논문은 연속된 임bedding 공간에서 변형을 최적화하고, 마스크된 언어 모델을 통해 복원함으로써 컴퓨터 비전(CV)과 자연어 처리(NLP)를 연결하는 통합된 기울기 기반 적대적 공격 프레임워크를 제안한다. 이 방법은 T-PGD로 명명되며, 전이 가능한 블랙박스 설정에서 최신 기준을 달성하면서도 높은 텍스트 품질을 유지한다.

ABSTRACT

Despite recent success on various tasks, deep learning techniques still perform poorly on adversarial examples with small perturbations. While optimization-based methods for adversarial attacks are well-explored in the field of computer vision, it is impractical to directly apply them in natural language processing due to the discrete nature of the text. To address the problem, we propose a unified framework to extend the existing optimization-based adversarial attack methods in the vision domain to craft textual adversarial samples. In this framework, continuously optimized perturbations are added to the embedding layer and amplified in the forward propagation process. Then the final perturbed latent representations are decoded with a masked language model head to obtain potential adversarial samples. In this paper, we instantiate our framework with an attack algorithm named Textual Projected Gradient Descent (T-PGD). We find our algorithm effective even using proxy gradient information. Therefore, we perform the more challenging transfer black-box attack and conduct comprehensive experiments to evaluate our attack algorithm with several models on three benchmark datasets. Experimental results demonstrate that our method achieves overall better performance and produces more fluent and grammatical adversarial samples compared to strong baseline methods. The code and data are available at \url{https://github.com/Phantivia/T-PGD}.

연구 동기 및 목표

  • 텍스트의 이산성으로 인해 기울기 기반 최적화가 어려운 자연어 처리(NLP)와 컴퓨터 비전(CV) 간의 적대적 공격 방법 간 격차를 해소하기 위해.
  • 진단 정보만 제공되는 블랙박스 설정에서 효과적이고 유창한 적대적 텍스트를 제작하는 과제를 해결하기 위해.
  • 이산 토큰이 아닌 연속적인 임베딩에서 작동함으로써 NLP에서 최적화 기반 공격을 가능하게 하는 일반화 가능한 프레임워크를 개발하기 위해.
  • 프록시 모델과 마스크된 언어 모델링을 활용하여 잠재 표현을 복원함으로써 NLP에서의 전이 가능성과 강건성을 향상시키기 위해.
  • 효과적이면서도 언어적으로 일관된 적대적 샘플을 생성하여 히ュ리스틱 또는 이산 치환 기반 방법을 뛰어넘기 위해.

제안 방법

  • 프레임워크는 기울기 기반 변형이 이산 토큰이 아닌 토큰 임베딩에 직접 적용되는 연속된 임베딩 공간에서 작동한다.
  • 변형은 신경망 내에서 전방 전파를 통해 증폭되어 최종 은닉 표현에 더 큰 영향을 미친다.
  • 마스크된 언어 모델(MLM) 헤드를 사용하여 변형된 잠재 표현을 이산적이고, 자연스럽고 문법적으로 올바른 텍스트로 복원한다.
  • 진짜 공격 대상 모델의 기울기가 이용 가능하지 않을 경우, 국소 프록시 모델을 사용해 기울기 신호를 생성함으로써 의사결정 기반 블랙박스 공격을 가능하게 한다.
  • 이 방법은 PGD의 변형인 T-PGD로 구현되며, 프록시 기울기와 MLM 복원을 활용해 고품질의 적대적 예제를 생성한다.
  • 프록시 모델을 공격 대상과 다른 데이터셋에서 학습시킴으로써, 실제 세계의 제약 조건을 시뮬레이션하면서 다양한 데이터셋과 모델 간 전이 공격을 가능하게 한다.

실험 결과

연구 질문

  • RQ1텍스트의 이산성에도 불구하고 컴퓨터 비전에서 유래한 기울기 기반 적대적 공격 방법이 자연어 처리에 효과적으로 적용될 수 있는가?
  • RQ2어떻게 임베딩 공간에서 변형을 최적화하여 고품질의, 자연스럽고 문법적으로 올바른 적대적 텍스트를 생성할 수 있는가?
  • RQ3모델 예측 결과만 제공되고 기울기가 제공되지 않는 블랙박스 설정에서 적대적 공격의 전이 가능성은 어느 정도 이루어질 수 있는가?
  • RQ4마스크된 언어 모델 헤드가 변형된 잠재 표현에서 일관된 적대적 텍스트를 효과적으로 복원할 수 있는가?
  • RQ5다양한 모델과 데이터셋에서 공격 성공률, 유창성, 문법성 측면에서 제안된 T-PGD 방법이 강력한 기준 방법보다 어떻게 성능을 발휘하는가?

주요 결과

  • T-PGD는 다른 모델에서 제작된 적대적 예제를 사용해 BERT를 공격할 때 RoBERTa에서 45.29%의 공격 성공률을 기록하여 기준 방법들을 크게 앞서며 성능을 뛰어올랐다.
  • SST-2 데이터셋에서 국소 프록시 모델이 동일한 데이터셋에서 학습된 경우 T-PGD는 97.00%의 공격 성공률을 기록하여 높은 효과성을 입증했다.
  • 이 방법은 평균 PPL(혼란도) 343.65를 기록하여 기준 방법 대비 강력한 유창성과 문법 정확성을 보였다.
  • IMDB, Amazon 등의 다른 데이터셋 간 전이 설정에서 T-PGD는 각각 93.30%와 96.40%의 공격 성공률을 유지하며 뛰어난 성능을 보였다.
  • 프레임워크는 오직 모델 예측 결과만을 사용하는 의사결정 기반 블랙박스 공격을 성공적으로 수행했으며, 공격 대상 모델의 기울기가 제공되지 않더라도 효과적임을 입증했다.
  • MLM 헤드의 사용이 적대적 텍스트의 품질을 크게 향상시켜, 변형에도 불구하고 자연스럽고 문법적으로 올바른 텍스트를 유지하는 데 기여했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.