Skip to main content
QUICK REVIEW

[논문 리뷰] Generating Adversarial Examples in Chinese Texts Using Sentence-Pieces

Linyang Li, Yunfan Shao|arXiv (Cornell University)|2020. 12. 29.
Topic Modeling참고 문헌 27인용 수 9
한 줄 요약

이 논문은 문장 조각 토크나이제이션과 사전 훈련된 마스킹 언어 모델을 사용하여 중국어 텍스트의 서브워드 수준에서 자연스럽고 유창한 악성 예측 예제를 생성하는 방법을 제안한다. 서브워드 수준에서 자연스럽고 흐름 있는 악성 예측 예제를 생성함으로써 의미적 일관성과 유창성을 유지하면서도 공격 성공률가 높아졌으며, 품질과 인간 평가에서 문자 수준 및 단어 수준의 방법들을 능가한다.

ABSTRACT

Adversarial attacks in texts are mostly substitution-based methods that replace words or characters in the original texts to achieve success attacks. Recent methods use pre-trained language models as the substitutes generator. While in Chinese, such methods are not applicable since words in Chinese require segmentations first. In this paper, we propose a pre-train language model as the substitutes generator using sentence-pieces to craft adversarial examples in Chinese. The substitutions in the generated adversarial examples are not characters or words but extit{'pieces'}, which are more natural to Chinese readers. Experiments results show that the generated adversarial samples can mislead strong target models and remain fluent and semantically preserved.

연구 동기 및 목표

  • 단어 경계가 모호한 중국어 텍스트에서 높은 품질의 악성 예측 예제를 생성하는 데 도전하는 것.
  • 기존의 단어 수준 또는 문자 수준의 교체 방법의 한계를 극복하기 위해 서브워드 수준(피스 수준)의 교체 전략을 도입하는 것.
  • 문장 조각 토크나이제이션을 사용하여 사전 훈련된 마스킹 언어 모델을 개발하여 의미적으로 일관되고 자연스러운 악성 예측 예제를 생성하는 것.
  • 강력한 BERT 기반 모델을 공격할 때 의미적 정합성과 인간 독해 가능성 유지와 함께 악성 예측 예제의 효과성을 평가하는 것.

제안 방법

  • 대규모 중국어 텍스트에서 문장 조각 토크나이제이션을 사용하여 서브워드 단위를 포괄하는 피스 수준의 어휘를 생성하기 위해 마스킹 언어 모델을 훈련하는 것.
  • 사전 훈련된 모델을 서브워드 수준에서의 교체 후보를 생성하는 교체 생성기로 사용하여, 문자 수준이나 단어 수준이 아닌 피스 수준에서 교체를 수행하는 것.
  • 입력 텍스트의 특정 피스를 교체하여 타겟 모델을 오도하는 악성 예측 예제를 제작하기 위해 교체 생성기를 적용하는 것. 이 과정에서 유창성과 의미 일관성을 유지하는 것.
  • 타겟 모델의 아키텍처가 알려져 있지 않은 블랙박스 공격 설정을 사용하며, 예측 점수만을 활용하여 공격를 이끄는 것.
  • 공격 과정에서 고품질의 교체 후보를 필터링하기 위해 사전 훈련된 임베딩과 코사인 유사도를 사용하는 것.
  • 유창성과 레이블 유지 정도를 평가하기 위해 인간 평가를 실시하여 악성 예측 예제가 자연스럽고 의미적으로 일관되게 유지되는지 확인하는 것.

실험 결과

연구 질문

  • RQ1문장 조각 토크나이제이션을 통해 생성된 피스 수준의 교체가 문자 수준 또는 단어 수준의 방법보다 더 자연스럽고 의미가 유지된 중국어 텍스트의 악성 예측 예제를 생성할 수 있는가?
  • RQ2문장 조각 토크나이제이션 토큰에서 훈련된 사전 훈련된 마스킹 언어 모델이 중국어 텍스트 분류 모델에 대해 높은 품질의 악성 교체 후보를 생성하는 데 얼마나 효과적인가?
  • RQ3교체 후보 목록의 크기와 생성된 악성 예측 예제의 품질(유창성, 의미 유지) 사이의 상호 상충 관계는 어떠한가?
  • RQ4피스 수준의 악성 예측 예제가 다양한 중국어 NLP 작업에서 강력하고 미세조정된 BERT 기반 모델을 얼마나 효과적으로 공격하는가?

주요 결과

  • 제안된 피스 수준의 악성 예측 공격는 IflyTek에서 11.0%, Weibo에서 35.0%, Sogou에서 18.5%, Law34에서 12.0%의 공격 성공률를 기록하였으며, 유창성과 의미 품질 측면에서 문자 수준 및 단어 수준의 기준 모델들을 능가하였다.
  • 인간 평가자들은 IflyTek에서 94%, Weibo에서 90%, Sogou에서 93%, Law34에서 97%의 악성 예측 예제에서 정확히 레이블을 식별하였으며, 이는 강력한 레이블 유지 정도를 의미한다.
  • 생성된 악성 예측 예제의 평균 유창성 점수는 IflyTek에서 4.5, Weibo에서 4.2, Sogou에서 4.2, Law34에서 4.8이었으며, 이는 문자 수준 방법보다 유의미하게 높았다.
  • 약간 낮은 공격 성공률에도 불구하고, 피스 수준 방법은 문자 수준 및 단어 수준의 기준 모델보다 더 높은 유창성과 더 나은 의미 유지 정도를 보였으며, 이는 악성 예측 예제의 품질이 뛰어나다는 것을 시사한다.
  • 상호 상충 곡선 분석 결과, 후보 목록 크기를 늘일수록 공격 성공률는 향상되었지만, 피스 수준 방법은 중간 크기의 목록에서도 높은 유창성과 의미 일관성을 유지하는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.