Skip to main content
QUICK REVIEW

[논문 리뷰] SAFER: A Structure-free Approach for Certified Robustness to Adversarial Word Substitutions

Mao Ye, Chengyue Gong|arXiv (Cornell University)|2020. 05. 29.
Adversarial Robustness in Machine Learning참고 문헌 13인용 수 8
한 줄 요약

SAFER는 랜덤 싱기니미즘을 사용한 랜덤라이즈드 스무딩을 통해 자연어 처리 모델에 대한 인간이 감지할 수 없는 어절 치환 공격에 대해 구조 자유형, 블랙박스로 검증된 강건성 방식을 제안한다. 이는 모델 아키텍처 접근이 불필요하며, IMDB에서 BERT에 대해 87.35%의 최고 수준의 검증 정확도를 달성하여 이전의 IBP 기반 방법보다 IMDB 및 아마존 데이터셋에서 모두 뛰어난 성능을 보인다.

ABSTRACT

State-of-the-art NLP models can often be fooled by human-unaware transformations such as synonymous word substitution. For security reasons, it is of critical importance to develop models with certified robustness that can provably guarantee that the prediction is can not be altered by any possible synonymous word substitution. In this work, we propose a certified robust method based on a new randomized smoothing technique, which constructs a stochastic ensemble by applying random word substitutions on the input sentences, and leverage the statistical properties of the ensemble to provably certify the robustness. Our method is simple and structure-free in that it only requires the black-box queries of the model outputs, and hence can be applied to any pre-trained models (such as BERT) and any types of models (world-level or subword-level). Our method significantly outperforms recent state-of-the-art methods for certified robustness on both IMDB and Amazon text classification tasks. To the best of our knowledge, we are the first work to achieve certified robustness on large systems such as BERT with practically meaningful certified accuracy.

연구 동기 및 목표

  • 인간이 감지할 수 없는 어절 치환 공격에 대해 자연어 처리 모델의 검증된 강건성에 대한 필수적인 요구를 해결한다.
  • 기존의 검증된 방어 방법이 모델 아키텍처 접근이 필요하거나 연속형 입력에 국한되는 한계를 극복한다.
  • 어떤 사전 학습된 모델(예: BERT)과 모델 유형(어절 수준 또는 서브워드 수준)에 대해 블랙박스, 구조 자유형 접근을 통해 검증된 강건성을 실현한다.
  • 기존 검증 방법이 적용되지 않는 대규모 모델인 BERT와 같은 모델에서 실용적인 검증 정확도를 달성한다.

제안 방법

  • 사전 정의된 동의어 집합을 사용하여 입력 문장에 랜덤 동의어 치환을 적용함으로써 확률적 앙상블을 구성한다.
  • 이 앙상블의 통계적 성질을 활용하여 허브스트링 거리 R 이내의 임의의 어절 치환에 대해 강건성에 대한 증명 가능한 경계를 유도한다.
  • 이미지와 같은 연속형 입력을 초월하여 문장과 같은 이산적이고 구조화된 입력 공간에서 랜덤라이즈드 스무딩을 적용한다.
  • 각 입력에 대해 강건성 반경 Δ_X를 추정하기 위해 5,000회의 몬테카를로 샘플링을 수행하여 검증의 통계적 신뢰도를 확보한다.
  • 편향된 입력들 중 다수 예측 클래스를 기반으로 예측하는 스무딩 분류기 f*를 정의하며, 이에 기반한 검증은 예측이 유지되는 편향의 비율에 따라 결정된다.
  • 만약 예측 클래스 y를 유지하는 편향의 비율이 임계값(p_A ≥ q)을 초과할 경우, 모델은 반경 R 내에서 검증된 강건성을 확보한다.

실험 결과

연구 질문

  • RQ1모델 아키텍처나 기울기 접근이 없이도 자연어 처리 모델에 대해 어절 치환 공격에 대해 검증된 강건성을 달성할 수 있는가?
  • RQ2랜덤라이즈드 스무딩이 자연어 처리에서 이산적이고 구조화된 입력(예: 문장)으로 효과적으로 확장될 수 있는가?
  • RQ3이 방법이 기존 검증 방법이 실패하는 대규모 사전 학습 모델인 BERT와 같은 모델에서 높은 검증 정확도를 달성할 수 있는가?
  • RQ4이 구조 자유형 방법의 성능은 표준 자연어 처리 벤치마크에서 IBP 기반 검증 방어와 비교해 어떻게 되는가?
  • RQ5이 블랙박스 접근을 통해 실생활 데이터셋인 IMDB 및 아마존에서 실현 가능한 실용적 검증 정확도는 얼마인가?

주요 결과

  • SAFER는 BERT에 적용되었을 때 IMDB 데이터셋에서 87.35%의 검증 정확도를 달성하였으며, 이는 이전의 검증 방법으로는 달성할 수 없었던 결과이다.
  • 이 방법은 IMDB 및 아마존 텍스트 분류 작업 모두에서 IBP 기반 접근보다 뚜렷이 뛰어난 성능을 보이며, 더 높은 강건성과 정확도를 입증한다.
  • BERT와 같은 대규모 모델에 대해 실용적으로 의미 있는 정확도로 처음으로 검증된 강건성을 달성하여 실세계 적용이 가능하게 되었다.
  • 이 방법은 구조 자유형이며 블랙박스이므로 오직 모델 쿼리 접근만 필요하므로, 어절 수준 및 서브워드 수준의 모든 자연어 처리 모델에 적용 가능하다.
  • 아마존 데이터셋에서는 데이터셋의 막대한 규모와 높은 레이블 다양성에도 불구하고 SAFER는 높은 검증 정확도를 유지한다.
  • 이 방법은 텍스트 CNN, 캐릭터-CNN, BERT 등 다양한 모델 유형으로 일반화되며, 광범위한 적용 가능성과 강건성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.