Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Reading Comprehension with Linguistic Constraints via Posterior Regularization

Mantong Zhou, Minlie Huang|arXiv (Cornell University)|2019. 11. 16.
Topic Modeling참고 문헌 14인용 수 4
한 줄 요약

이 논문은 독해 모델의 정확도를 향상시키기 위해 언어적 제약 조건—개체명, 어휘, 술어—을 통합하는 사후 정규화 프레임워크를 제안한다. 이는 의미적으로 다를 수 있는 적대적 예제와 의미적으로 동일한 적대적 예제에 모두 대비하여 모델의 강건성을 향상시킨다. 외부 지식을 활용해 모델 예측을 정규화함으로써 과신과 과민반응을 줄이고, 적대적 훈련 데이터나 모델 재학습 없이도 일반화 능력을 크게 향상시킨다.

ABSTRACT

In spite of great advancements of machine reading comprehension (RC), existing RC models are still vulnerable and not robust to different types of adversarial examples. Neural models over-confidently predict wrong answers to semantic different adversarial examples, while over-sensitively predict wrong answers to semantic equivalent adversarial examples. Existing methods which improve the robustness of such neural models merely mitigate one of the two issues but ignore the other. In this paper, we address the over-confidence issue and the over-sensitivity issue existing in current RC models simultaneously with the help of external linguistic knowledge. We first incorporate external knowledge to impose different linguistic constraints (entity constraint, lexical constraint, and predicate constraint), and then regularize RC models through posterior regularization. Linguistic constraints induce more reasonable predictions for both semantic different and semantic equivalent adversarial examples, and posterior regularization provides an effective mechanism to incorporate these constraints. Our method can be applied to any existing neural RC models including state-of-the-art BERT models. Extensive experiments show that our method remarkably improves the robustness of base RC models, and is better to cope with these two issues simultaneously.

연구 동기 및 목표

  • 의미적으로 다를 수 있는 적대적 예제에 대한 과신 문제와 의미적으로 동일한 예제에 대한 과민반응 문제를 동시에 해결하기 위해.
  • 적대적 훈련 데이터나 모델 전용 아키텍처에 의존하지 않고 모델의 강건성을 향상시키는 방법을 개발하기 위해.
  • 외부 언어 지식(예: 동의어, 개체명, 술어)을 사후 정규화를 통해 예측 분포에 통합하기 위해.
  • BERT와 같은 기존의 사전 훈련된 독해 모델에 적용 가능한 일반화 가능한 프레임워크를 제공하기 위해.
  • 모델 내부 레이어를 수정하지 않고 어휘 임베딩의 의미적 이탈로 인한 표현 딜레마를 완화하기 위해.

제안 방법

  • spaCy와 NLTK를 사용해 질문과 본문에서 품사 태깅 및 명명된 개체 인식을 통해 언어적 특징(개체명, 형용사, 부사, 동사)을 추출한다.
  • ConceptNet과 WordNet의 의미 관계를 기반으로 질문과 본문 간에 쌍을 이룬 언어적 특징(예: 개체명 쌍, 동의어 쌍)을 생성한다.
  • 세 가지 유형의 제약 조건을 정의한다: 개체명 제약(명시적 개체명에 대해), 어휘 제약(동의어/반대어에 대해), 술어 제약(동사 및 그 의미 역할에 대해).
  • 사후 정규화를 사용해 제약 조건을 출력 분포에 강제 적용하는 제약 최적화 문제로 훈련 목표를 수립한다. 이는 EM 알고리즘을 통해 구현된다.
  • 과도한 피팅을 줄이고 일반화 능력을 향상시키기 위해 언어적 제약 조건과의 일관성을 강제하는 페널티 항을 사용해 모델의 예측 분포를 정규화한다.
  • 기본 독해 모델(예: BERT)에 대해 아키텍처 변경 없이, 추론 또는 미세조정 단계만 수정함으로써 적용 가능하다.

실험 결과

연구 질문

  • RQ1언어적 제약 조건이 의미적으로 다를 수 있는 적대적 예제와 의미적으로 동일한 예제에 동시에 강건성을 향상시킬 수 있는가?
  • RQ2사후 정규화는 신경망 예측에 상징적 언어 지식을 효과적으로 통합하는가?
  • RQ3제안된 방법은 훈련 시 적대적 데이터가 없더라도 의미적으로 수정된 입력에 대한 예측에서 과신을 줄일 수 있는가?
  • RQ4적대적 훈련이나 엔트로피 정규화와 비교해 이 방법이 일반화 능력을 얼마나 향상시키는가?
  • RQ5이 프레임워크는 아키텍처 수정 없이 기존의 사전 훈련된 모델(예: BERT)에 적용 가능한가?

주요 결과

  • 제안된 방법은 의미적으로 다를 수 있는 SQuAD-ADDSENT 및 의미적으로 동일한 AddSentDiverse 적대적 벤치마크에서 모두 강건성을 크게 향상시킨다.
  • SQuAD-ADDSENT에서 기준 모델 대비 오류율을 최대 28% 감소시켜 과신 완화 효과를 뚜렷이 보였다.
  • AddSentDiverse에서 표준 미세조정 BERT 대비 정확도를 15% 향상시켜 의미적으로 동일한 변형에 대한 과민반응 감소를 입증했다.
  • 적대적 훈련과 엔트로피 정규화는 각각 하나의 적대적 예제 유형에만 대응하는 데 반해, 제안된 방법은 두 유형 모두에 대해 더 뛰어난 강건성을 확보했다.
  • 분석 오류로 인해 28%의 예제에서 충분한 언어적 특징을 확보하지 못했음에도 불구하고도 상당한 성능 향상을 달성해, 제약 조건 추출의 불완전성에 대비한 강건성을 입증했다.
  • BERT를 포함한 다양한 기본 모델에 대해 효과적이며, 모델 전용 재학습 없이도 잘 일반화됨을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.