Skip to main content
QUICK REVIEW

[논문 리뷰] Text-CRS: A Generalized Certified Robustness Framework against Textual Adversarial Attacks

Xinyu Zhang, Hanbin Hong|arXiv (Cornell University)|2023. 07. 31.
Topic ModelingComputer Science참고 문헌 69인용 수 3
한 줄 요약

Text-CRS는 랜덤화 스무딩을 사용하여 동의어 치환, 재정렬, 삽입, 삭제의 네 가지 단어 수준의 적대적 작동에 대비해 일반화된 인증된 강건성 프레임워크를 제안한다. 이러한 작동을 순열 및 임베딩 변환의 조합으로 모델링하고, 맞춤형 노이즈 분포를 도입함으로써 Text-CRS는 네 가지 작동 전반에서 최고 수준의 인증된 정확도와 반경을 달성하며, NLP에서 인증된 강건성에 대한 첫 번째 종합 기준을 수립한다.

ABSTRACT

The language models, especially the basic text classification models, have been shown to be susceptible to textual adversarial attacks such as synonym substitution and word insertion attacks. To defend against such attacks, a growing body of research has been devoted to improving the model robustness. However, providing provable robustness guarantees instead of empirical robustness is still widely unexplored. In this paper, we propose Text-CRS, a generalized certified robustness framework for natural language processing (NLP) based on randomized smoothing. To our best knowledge, existing certified schemes for NLP can only certify the robustness against $\ell_0$ perturbations in synonym substitution attacks. Representing each word-level adversarial operation (i.e., synonym substitution, word reordering, insertion, and deletion) as a combination of permutation and embedding transformation, we propose novel smoothing theorems to derive robustness bounds in both permutation and embedding space against such adversarial operations. To further improve certified accuracy and radius, we consider the numerical relationships between discrete words and select proper noise distributions for the randomized smoothing. Finally, we conduct substantial experiments on multiple language models and datasets. Text-CRS can address all four different word-level adversarial operations and achieve a significant accuracy improvement. We also provide the first benchmark on certified accuracy and radius of four word-level operations, besides outperforming the state-of-the-art certification against synonym substitution attacks.

연구 동기 및 목표

  • NLP에서 다양한 단어 수준의 적대적 작동에 대한 증명 가능한 강건성 보장을 위한 부족함을 해결하기 위해.
  • $ε$-강건성에 대한 동의어 치환을 넘어서 재정렬, 삽입, 삭제를 포함한 인증된 강건성을 확장하기 위해.
  • 이산 텍스트 변형에 대해 랜덤화 스무딩을 일반화하는 통합된 프레임워크를 개발하기 위해.
  • 최적화된 노이즈 분포와 향상된 훈련을 통해 인증된 정확도와 강건성 반경을 향상시키기 위해.
  • 네 가지 상이한 단어 수준의 적대적 작동에 대해 인증된 정확도와 반경에 대한 첫 번째 기준을 수립하기 위해.

제안 방법

  • 동의어 치환, 재정렬, 삽입, 삭제와 같은 각 단어 수준의 적대적 작동을 순열 및 임베딩 공간 변환의 조합으로 표현하기.
  • 순열 및 임베딩 공간에서의 인증된 강건성 한계를 유도하기 위해 새로운 스무딩 정리를 도출하기.
  • 다양한 작동에 맞는 $ε$-노름 ($\ell_1$, $\ell_2$, $\ell_0$)과 일치하는 이산 노이즈 분포—계단형, 가우시안, 베르누이—를 사용한 일반화된 스무딩 프레임워크 도입하기.
  • 이산 단어 간 수치적 관계를 기반으로 한 노이즈 선택 전략을 제안하여 인증된 정확도와 강건성 반경을 향상시키기.
  • 새로운 노이즈 분포 하에서 스무딩 분류기 성능을 최적화하는 향상된 훈련 툴킷 설계하기.
  • 다양한 사전 학습된 언어 모델과 데이터셋에 프레임워크를 적용하여 강건성과 일반화 능력을 검증하기.

실험 결과

연구 질문

  • RQ1랜덤화 스무딩이 동의어 치환을 초월해 다수의 단어 수준의 적대적 작동에 대해 인증된 강건성을 일반화할 수 있는가?
  • RQ2순열 및 임베딩 공간 변환을 함께 모델링하여 다양한 텍스트 변형에 대한 강건성 한계를 도출할 수 있는가?
  • RQ3이산 텍스트 작동에 대해 인증된 정확도와 강건성 반경을 최대화하는 데 가장 효과적인 노이즈 분포는 무엇인가?
  • RQ4통합된 스무딩 프레임워크가 네 가지 기본적인 단어 수준의 작동 전반에서 실용적인 인증된 강건성을 달성할 수 있는가?
  • RQ5제안된 방법은 인증된 정확도와 강건성 반경 측면에서 최신 기술 대비 어떻게 비교되는가?

주요 결과

  • Text-CRS는 동의어 치환 공격에 대해 기존의 SAFER 및 CISS와 같은 방법들을 능가하는 최고 수준의 인증된 정확도와 반경을 달성한다.
  • 이 프레임워크는 이전에 인증된 방어에서 다루지 못했던 단어 재정렬, 삽입, 삭제에 대해 인증된 강건성에 대한 첫 번째 기준을 수립한다.
  • 맞춤형 노이즈 분포(계단형, 가우시안, 베르누이)를 사용함으로써, 균일하거나 표준 가우시안 노이즈보다 인증된 정확도와 강건성 반경이 크게 향상된다.
  • 감성 분석 및 텍스트 분류와 같은 작업에서 BERT와 RoBERTa와 같은 다양한 언어 모델과 데이터셋에 걸쳐 강력한 일반화 능력을 보여준다.
  • 향상된 훈련 툴킷은 노이즈 분포 선택의 효과를 검증하며, 인증된 정확도에 명백한 향상을 이룬다.
  • Text-CRS는 네 가지 단어 수준의 작동 전반에 대해 실용적인 인증 반경을 제공하며, 실제 적대적 환경에서 측정 가능한 강건성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.