Skip to main content
QUICK REVIEW

[논문 리뷰] Certified Robustness Against Natural Language Attacks by Causal Intervention

Haiteng Zhao, Chang Ma|arXiv (Cornell University)|2022. 05. 24.
Adversarial Robustness in Machine Learning인용 수 11
한 줄 요약

이 논문은 자연어 공격에 대해 인증된 내성적 강건성을 달성하기 위해 인과적 영향 $p(y|do(x))$를 의미 공간 스무딩을 통해 모델링하는 새로운 프레임워크인 인과적 간섭을 통한 의미 스무딩(CISS)을 제안한다. CISS는 통합된 공격 하에서 IMDB에서 76.5%의 인증된 강건성 정확도와 YELP에서 80.7%의 실증적 강건성을 기록하며 최신 기술을 초월한다.

ABSTRACT

Deep learning models have achieved great success in many fields, yet they are vulnerable to adversarial examples. This paper follows a causal perspective to look into the adversarial vulnerability and proposes Causal Intervention by Semantic Smoothing (CISS), a novel framework towards robustness against natural language attacks. Instead of merely fitting observational data, CISS learns causal effects p(y|do(x)) by smoothing in the latent semantic space to make robust predictions, which scales to deep architectures and avoids tedious construction of noise customized for specific attacks. CISS is provably robust against word substitution attacks, as well as empirically robust even when perturbations are strengthened by unknown attack algorithms. For example, on YELP, CISS surpasses the runner-up by 6.7% in terms of certified robustness against word substitutions, and achieves 79.4% empirical robustness when syntactic attacks are integrated.

연구 동기 및 목표

  • 딥 NLP 모델의 공격에 대한 취약성을 해결하기 위해, 특히 단어 대체 및 문법적 변형 공격에 대비하는 것.
  • 모델의 취약성의 근본 원인으로서의 혼동 변수를 규명하고, 인과적 시각을 통해 공격에 대한 강건성을 이해하는 것.
  • 공격에 특화된 노이즈 엔지니어링을 피하는 확장 가능한 인증된 강건성 프레임워크를 개발하는 것.
  • 기존 및 알려지지 않은 공격에 대해 증명 가능한(인증된) 및 실증적 강건성을 동시에 달성하는 것.

제안 방법

  • CISS는 잠재적 의미 공간에서 혼동 변수의 영향을 제거하여 $p(y|do(x))$의 간섭 분포를 모델링함으로써 NLP에서 인과적 추론을 가능하게 한다.
  • 사전 훈련된 모델(예: BERT)의 잠재 공간에서 의미 스무딩을 적용하여 $p(y|do(x))$를 근사함으로써 입력 공간의 노이즈 분포에 의존하지 않는다.
  • 이 방법은 랜덤화 스무딩에 기반하며, 스무딩 분류기는 $p(y|do(x)) = \int p(y|x,n)p(n)\,dn$으로 표현되며, 이는 인과적 관점에서의 강건성에 이론적 근거를 제공한다.
  • CISS는 잠재 표현에 대해 미분 가능한 스무딩 전략을 사용하여 엔드 투 엔드 훈련이 가능하고, 트랜스포머에까지 확장 가능하다.
  • 이 프레임워크는 공격 알고리즘이 알려지지 않은 방식으로 변형되어도 강건성을 유지할 수 있는데, 이는 인과적 불변성 덕분이다.
  • 스무딩 강도 $\gamma$와 잠재 노이즈 강도 $m$과 같은 하이퍼파라미터는 강건성과 정확도의 균형을 위해 조정되며, $\sigma$에 대해 최소한의 민감도를 보인다.

실험 결과

연구 질문

  • RQ1NLP 모델의 공격에 대한 취약성은 조작 가능한 혼동 변수(예: 스타일 또는 전문 용어)에 의해 유도된 유사 상관관계 때문일 수 있는가?
  • RQ2랜덤화 스무딩은 인과적 영향 $p(y|do(x))$를 추정하는 것으로 해석될 수 있으며, 이는 인증된 강건성에 대한 이론적 기반을 제공하는가?
  • RQ3의미 공간 스무딩은 트랜스포머와 같은 깊은 아키텍처로도 확장 가능한 증명 가능한 강건한 NLP 모델을 도출할 수 있는가?
  • RQ4잠재 공간에서 인과적 영향을 모델링하면, 문법적 및 편집 기반 변형 공격을 포함한 알려진 및 알려지지 않은 공격에 모두 강건성이 확보되는가?

주요 결과

  • IMDB 데이터셋에서 CISS는 단어 대체 공격에 대해 76.5%의 인증된 강건성 정확도를 기록했으며, 2위보다 7.2%포인트 높다.
  • YELP 데이터셋에서 CISS는 통합된 문법적 공격 하에서 80.7%의 실증적 강건성을 확보했으며, 2위보다 6.8%포인트 높다.
  • CISS는 다양한 하이퍼파라미터 설정에서도 강력한 인증된 강건성을 보였다: YELP에서는 $\gamma=4$ 및 $m=1$일 때 75.25%의 인증 정확도를 기록했고, IMDB에서는 $\sigma$ 값이 0.5에서 4 사이일 때 90% 이상의 인증 강건성을 유지했다.
  • CISS의 성능은 가우시안 노이즈 표준편차 $\sigma$에 대해 최소한의 민감도를 보이며, 이는 하이퍼파라미터 조정에 대한 강건성을 시사한다 — 기존의 랜덤화 스무딩 방법과는 달리.
  • YELP에서 통합 공격 하에서 CISS는 83.1%의 실증적 강건성을 확보했으며, 2위보다 7.8%포인트 높다.
  • 제거 실험 결과, 잠재 의미 공간에서의 스무딩이 핵심임을 확인했다: 입력 공간에서 스무딩을 적용하거나 인과적 간섭 없이 적용할 경우 성능이 크게 저하된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.