Skip to main content
QUICK REVIEW

[논문 리뷰] CAT-Gen: Improving Robustness in NLP Models via Controlled Adversarial Text Generation

Tianlu Wang, Xuezhi Wang|arXiv (Cornell University)|2020. 10. 05.
Topic Modeling참고 문헌 25인용 수 7
한 줄 요약

CAT-Gen는 감성 분류와 같은 작업에서 관련이 없는 속성(예: 제품 카테고리)을 사용하여 제어 가능한 대비적 텍스트 생성 프레임워크를 제안한다. 이는 사전 훈련된 언어 모델을 활용하고 공격 생성과 속성 학습을 분리함으로써 기존 방법보다 더 우수한 유창성, 다양성, 이식성(transferability)을 가진 다양한 유창한 대비적 예제를 생성함으로써 NLP 모델의 강건성을 향상시킨다.

ABSTRACT

NLP models are shown to suffer from robustness issues, i.e., a model's prediction can be easily changed under small perturbations to the input. In this work, we present a Controlled Adversarial Text Generation (CAT-Gen) model that, given an input text, generates adversarial texts through controllable attributes that are known to be invariant to task labels. For example, in order to attack a model for sentiment classification over product reviews, we can use the product categories as the controllable attribute which would not change the sentiment of the reviews. Experiments on real-world NLP datasets demonstrate that our method can generate more diverse and fluent adversarial texts, compared to many existing adversarial text generation approaches. We further use our generated adversarial examples to improve models through adversarial training, and we demonstrate that our generated attacks are more robust against model re-training and different model architectures.

연구 동기 및 목표

  • 단어 치환 또는 연속적 표현을 통한 입력 변형 방식으로 인해 발생하는 기존 대비적 텍스트 생성 방법의 다양성과 유창성 부족 문제를 해결한다.
  • 원본 입력과 의미적으로 유사한 상태를 유지하면서 분류기를 속이기 위해 고품질의 대비적 예제를 생성함으로써 모델의 강건성을 향상시킨다.
  • 모델 재훈련 및 아키텍처 변경에 저항하는 대비적 예제를 통해 강건성 평가 및 훈련을 가능하게 한다.
  • 사전에 지정된 레이블과 무관한 속성(예: 도메인, 성별, 카테고리)을 사용하여 속성 학습과 공격 생성을 분리한다.
  • 제어 가능한 속성 조작이 더 효과적인 대비적 훈련과 다양한 모델 간 보다 강력한 일반화를 이끌어낼 수 있음을 입증한다.

제안 방법

  • 대규모 텍스트 코퍼스에서 미리 훈련된 인코더-디코더 아키텍처를 사용하여 자연스럽고 다양한 대비적 텍스트를 생성한다.
  • 주 작업 레이블과 관련이 없는 것으로 알려진 제어 가능한 속성(예: 제품 카테고리, 성별)을 인코딩하는 모듈 네트워크를 도입한다.
  • 입력 텍스트와 지정된 속성을 디코더에 조건부로 제공하여 타겟된 변형을 가능하게 하여 텍스트 생성을 제어한다.
  • 병렬 데이터가 필요 없이 보조 데이터셋을 사용하여 속성 모듈을 훈련함으로써 속성 학습을 분리할 수 있다.
  • 의미적 및 문법적 공간에서 원본 입력과의 편차를 최소화하면서 공격 성공률을 최대화하도록 생성 과정을 최적화한다.
  • 자동 평가 지표로 언어 모델의 퍼플렉서티와 BLEU-4 점수를 사용하여 생성된 대비적 예제의 유창성과 다양성 평가한다.

실험 결과

연구 질문

  • RQ1텍스트 생성에서 제어 가능한 속성 조작은 단어 치환 또는 임베딩 수준의 변형에 비해 더 유창하고 다양한 대비적 예제를 생성할 수 있는가?
  • RQ2모델 재훈련 및 아키텍처 변경 조건에서 CAT-Gen가 생성한 대비적 예제의 강건성은 기존 방법과 비교해 어떻게 되는가?
  • RQ3CAT-Gen가 생성한 대비적 예제는 얼마나 효과적으로 모델의 강건성을 향상시킬 수 있는가?
  • RQ4사전 지정된 작업과 관련 없는 속성을 사용할 경우 더 의미적으로 일관되고 이식성이 높은 대비적 공격가 가능한가?
  • RQ5이 프레임워크는 수동으로 지정된 속성 외에도 취약한 속성을 자동으로 식별할 수 있도록 확장될 수 있는가?

주요 결과

  • CAT-Gen는 TextFooler(1853.7)와 NL-adv(964.3)보다 유의미하게 낮은 퍼플렉서티(예: 언어 모델 1에서 729.5)를 기록하여 더 높은 유창성을 보였다.
  • CAT-Gen는 TextFooler(68.9)와 NL-adv(64.3)보다 더 높은 BLEU-4 점수(38.8)를 기록하여 생성된 출력의 다양성이 뛰어났다.
  • 재훈련된 WordCNN 모델에서 CAT-Gen 공격는 49.3%의 성공률 유지하여 TextFooler(84.7%)와 NL-adv(82.9%)보다 이식성이 뛰어났다.
  • 다른 아키텍처(WordLSTM)에서 테스트한 결과 CAT-Gen 공격는 가장 낮은 성공률(51.5%)을 기록하여 아키텍처 변화에 대한 강건성이 뛰어났다.
  • CAT-Gen 예제를 사용한 대비적 훈련은 보류된 대비적 집합에서 모델 정확도를 92.5%로 향상시켰으며, 기준선(예: TextFooler 증강 시 52.7%)을 크게 능가했다.
  • CAT-Gen 예제로 훈련된 모델는 다른 방법으로 생성된 공격에서도 높은 정확도(84.4–83.4)를 유지하여 강력한 일반화 및 강건성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.