Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Machine Comprehension Models via Adversarial Training

Yicheng Wang, Mohit Bansal|arXiv (Cornell University)|2018. 04. 17.
Topic Modeling참고 문헌 12인용 수 20
한 줄 요약

이 논문은 배경 문장의 위치 변화와 위조 답변 생성을 통해 적대적 예제의 다양성을 높이는 새로운 적대적 훈련 방법인 AddSentDiverse를 제안한다. 이는 기계 이해 모델의 강건성을 크게 향상시킨다. 의미 관계 특징(예: 동의어/반의어)을 결합하면, 적대적 SQuAD 평가에서 F1 점수가 36.5% 향상되며, 원래 작업 성능는 유지된다.

ABSTRACT

It is shown that many published models for the Stanford Question Answering Dataset (Rajpurkar et al., 2016) lack robustness, suffering an over 50% decrease in F1 score during adversarial evaluation based on the AddSent (Jia and Liang, 2017) algorithm. It has also been shown that retraining models on data generated by AddSent has limited effect on their robustness. We propose a novel alternative adversary-generation algorithm, AddSentDiverse, that significantly increases the variance within the adversarial training data by providing effective examples that punish the model for making certain superficial assumptions. Further, in order to improve robustness to AddSent's semantic perturbations (e.g., antonyms), we jointly improve the model's semantic-relationship learning capabilities in addition to our AddSentDiverse-based adversarial training data augmentation. With these additions, we show that we can make a state-of-the-art model significantly more robust, achieving a 36.5% increase in F1 score under many different types of adversarial evaluation while maintaining performance on the regular SQuAD task.

연구 동기 및 목표

  • 최신 기계 이해 모델이 SQuAD 데이터셋에서 적대적 평가에 취약함을 해결하기 위해.
  • 이전 적대적 훈련 방법이 적대적 데이터의 저분산성과 이용 가능한 통계적 상관관계로 인해 실패하는 한계를 극복하기 위해.
  • 특히 반의어와 같은 의미적 변형에 대해 AddSent 스타일 공격에 대한 모델의 강건성을 향상시키기 위해.
  • 의미 관계 학습(예: 동의어/반의어) 등의 모델 능력 향상과 다양한 적대적 훈련을 통합하면 강건성이 향상되는지 조사하기 위해.
  • 제안된 방법이 질의 응답 작업에서 다른 삽입 기반 적대적 공격으로 일반화 가능한지 확인하기 위해.

제안 방법

  • 배경 문장의 위치를 무작위로 변경하고 동적으로 다양한 위조 답변을 생성함으로써 변동성을 높이는 AddSentDiverse라는 적대적 예제 생성 알고리즘을 제안한다.
  • 고정된 위조 답변 세트와 동적 위조 답변 세트를 조합하여 답변 선택 패턴을 학습하는 것을 방지한다.
  • 의미적 추론 능력을 향상시키기 위해 WordNet 기반의 동의어 및 반의어 특징을 입력 강화 수단으로 도입한다.
  • 일반 SQuAD 데이터와 AddSentDiverse로 생성된 적대적 데이터를 모두 사용해 훈련함으로써 다양한 부정적 예제를 통해 강건성을 향상시킨다.
  • 이중 훈련 전략을 활용: 먼저 다양한 예제로 적대적 미세조정을 수행한 후, 일반화 능력을 향상시키기 위해 의미 관계 특징을 통합한다.
  • 다양한 변형 유형(AddSent, AddSentPrepend, AddSentMod)을 가진 여러 적대적 테스트 세트에서 모델 성능을 평가하여 다양한 공격 유형에 대한 강건성을 측정한다.

실험 결과

연구 질문

  • RQ1배경 문장의 위치 다양화와 위조 답변 생성을 통해 적대적 훈련 데이터의 분산을 높이면 모델의 강건성이 크게 향상되는가?
  • RQ2의미 관계 특징(예: 동의어/반의어)을 함께 훈련하면 반의어와 같은 의미적 변형에 대한 모델 성능이 향상되는가?
  • RQ3왜 단순한 적대적 훈련만으로는 의미적 변형에 대해 강건성이 향상되지 않으며, 이를 보완하기 위해 모델 능력을 어떻게 향상시킬 수 있는가?
  • RQ4제안된 방법이 다른 삽입 기반 적대적 공격으로 일반화 가능한가?
  • RQ5의미 특징을 적대적 훈련과 함께 통합하면 원래 SQuAD 작업 성능에 영향을 미치는가?

주요 결과

  • AddSentDiverse 기반의 적대적 훈련 모델은 AddSent 기반 훈련 대비 세 가지 적대적 테스트 세트에서 평균 F1 점수 24.22% 향상되었다.
  • AddSentDiverse와 동적 위조 답변을 사용해 훈련한 모델는 더 나은 일반화 성능를 보이며, 다른 위조 답변 세트를 가진 데이터셋에서도 성능 저하 없이 작동한다.
  • 의미 관계 특징(동의어/반의어)을 모델에 추가하면 기준 모델 대비 적대적 평가에서 F1 점수가 36.46% 향상된다.
  • Adversarial 훈련을 거친 BSAE+SA 모델는 원래 SQuAD 개발 세트에서 성능을 유지(84.49 F1)하지만, BSAE 모델는 적대적 훈련 시 1% 성능 저하를 보였다.
  • 오류 분석 결과, 나머지 오류의 63.7%는 원래 SQuAD 개발 세트에서 이미 잘못 분류된 질문에서 발생함을 확인하여, 강건성 향상 효과가 주로 적대적 변형에 대해 유효함을 시사한다.
  • 명사어 교체 기반 배경 문장과 의도치 않게 질문에 답하는 오류가 발생하는 불완전한 배경 문장에 대해서는 여전히 어려움을 겪고 있어, 아직 해결이 필요한 과제가 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.