Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Evaluating the Robustness of Chinese BERT Classifiers

Boxin Wang, Boyuan Pan|arXiv (Cornell University)|2020. 04. 07.
Adversarial Robustness in Machine Learning참고 문헌 20인용 수 8
한 줄 요약

이 논문은 중국어 BERT 분류기 대상으로 최소한의 변형을 통해 임베딩 공간에서 중요한 문자를 대체하는 새로운 문자 수준의 적대적 공격 방법 AdvChar를 제안한다. 평균적으로 두 개 이하의 문자 변경으로 분류 정확도를 91.8%에서 0%로 낮추지만, 인간의 성능은 크게 영향을 받지 않아 중국어 BERT 모델의 심각한 강건성 문제를 드러낸다.

ABSTRACT

Recent advances in large-scale language representation models such as BERT have improved the state-of-the-art performances in many NLP tasks. Meanwhile, character-level Chinese NLP models, including BERT for Chinese, have also demonstrated that they can outperform the existing models. In this paper, we show that, however, such BERT-based models are vulnerable under character-level adversarial attacks. We propose a novel Chinese char-level attack method against BERT-based classifiers. Essentially, we generate "small" perturbation on the character level in the embedding space and guide the character substitution procedure. Extensive experiments show that the classification accuracy on a Chinese news dataset drops from 91.8% to 0% by manipulating less than 2 characters on average based on the proposed attack. Human evaluations also confirm that our generated Chinese adversarial examples barely affect human performance on these NLP tasks.

연구 동기 및 목표

  • 기존 연구가 주로 영어에 초점을 맞추고 있는 바에 비해, 중국어 BERT 기반 분류기의 적대적 공격에 대한 강건성에 대해 조사한다.
  • 이산적이고 고어휘량인 중국어 텍스트 환경에서 효율적이고 확장 가능한 적대적 예제를 생성하는 데 도전한다.
  • 화이트박스 설정에서 생성된 적대적 예제가 블랙박스 모델로 전이되는지 평가하여 실제 공격 시나리오를 시뮬레이션한다.
  • 인간 평가를 통해 생성된 적대적 예제의 자연스러움과 인간에 의한 인지 불가능성을 검증한다.

제안 방법

  • AdvChar는 변형의 크기를 최소화하면서 공격 성공률를 극대화하기 위해 임베딩 공간에서 기울기 유도 문자 치환을 수행한다.
  • 이 방법은 이산적 문자 치환 과정의 미분 가능 근사화를 사용하여 임베딩 레이어를 통해 역전파를 가능하게 한다.
  • 공격 성공률와 변형 크기 사이의 트레이드오프를 제어하기 위해 초항수 c와 κ를 사용하는 제약 최적화 프레임워크를 적용한다.
  • 공격는 타겟 지정 및 비타겟 지정 설정 모두에 적용되어, BERT의 어텐션 메커니즘의 통계적 단서를 악용하는 적대적 예제를 생성한다.
  • 전이 가능성은 화이트박스에서 생성된 적대적 예제를 파ameters에 접근할 수 없는 블랙박스 BERT 모델에 적용하여 평가한다.
  • 인간 평가는 청소년어 사용자들이 정상 데이터셋과 적대적 데이터셋의 문장을 레이블링하여 인지적 유사도를 평가한다.

실험 결과

연구 질문

  • RQ1문자 수준의 적대적 공격가 중국어 BERT 분류기의 성능을 최소한의 변형으로 효과적으로 악화시킬 수 있는가?
  • RQ2제안된 AdvChar 방법이 중국어 언어에서 낮은 변형 수준을 유지하면서도 높은 공격 성공률를 달성하는 데 얼마나 효과적인가?
  • RQ3화이트박스 설정에서 생성된 적대적 예제가 블랙박스 BERT 모델로 전이되는 정도는 어느 정도인가?
  • RQ4인간 평가자들은 생성된 적대적 예제가 정상 입력과 비교해 의미적 및 문법적 통합성에 대해 어떻게 평가하는가?

주요 결과

  • 비타겟 공격는 THUCTC 및 WeChat 데이터셋에서 모두 100%의 성공률를 기록했으며, 평균적으로 두 개 이하의 문자 변경으로 BERT 정확도를 91.8%에서 0%로 낮췄다.
  • 타겟 지정 공격는 THUCTC 데이터셋에서 95%의 성공률, WeChat 데이터셋에서 100%의 성공률를 기록하여 특정 잘못된 레이블로 입력을 오분류하는 데 높은 정밀도를 보였다.
  • 전이 가능성 실험 결과, 화이트박스에서 생성된 적대적 예제는 WeChat 데이터셋에서 블랙박스 BERT 정확도를 88.2%에서 14.3%로 낮췄다.
  • 인간 평가 결과, 정상 예제 대비 성능 저하가 4%에 그쳐(84%에서 80%로), 공격가 인간 사용자에게 인지 불가능함을 시사했다.
  • 사례 연구 결과, BERT 모델이 특정 문자(예: 엔터테인먼트를 의미하는 'Yu', 금융 상품을 의미하는 'Qi')를 통계적 단서로 활용하고 있어, 타겟 지정 치환 공격에 취약함을 확인했다.
  • 초항수 c와 κ를 증가시키면 공격 성공률는 향상되었지만 더 많은 문자 변형이 필요해졌으며, 이는 효과성과 은밀함 사이의 트레이드오프를 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.