Skip to main content
QUICK REVIEW

[논문 리뷰] A Hybrid Neural Network Model for Commonsense Reasoning

Pengcheng He, Xiaodong Liu|arXiv (Cornell University)|2019. 07. 27.
Topic Modeling참고 문헌 29인용 수 7
한 줄 요약

이 논문은 공공의 지식 추론을 향상시키기 위해 공유된 BERT 기반의 문맥 인코더를 사용하여 마스크된 언어 모델(MLM)과 의미 유사도 모델(SSM)을 결합한 하이브리드 신경망(HNN) 모델을 제안한다. HNN은 세 가지 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성한다: WNLI에서 89.0%, WSC에서 75.1%, PDP60에서 90.0%로, 두 구성 요소가 상호보완적임을 입증하고 다중 작업 학습과 순위 손실를 통해 성능을 공동으로 향상시킴을 보여준다.

ABSTRACT

This paper proposes a hybrid neural network (HNN) model for commonsense reasoning. An HNN consists of two component models, a masked language model and a semantic similarity model, which share a BERT-based contextual encoder but use different model-specific input and output layers. HNN obtains new state-of-the-art results on three classic commonsense reasoning tasks, pushing the WNLI benchmark to 89%, the Winograd Schema Challenge (WSC) benchmark to 75.1%, and the PDP60 benchmark to 90.0%. An ablation study shows that language models and semantic similarity models are complementary approaches to commonsense reasoning, and HNN effectively combines the strengths of both. The code and pre-trained models will be publicly available at https://github.com/namisan/mt-dnn.

연구 동기 및 목표

  • 공통의 지식 추론을 향상시키기 위해 언어 모델링과 의미 유사도 접근 방식을 통합하는 것.
  • 표면 텍스트를 초월한 암묵적인 공통 지식이 필요한 윈오그라드 스키마(Winograd Schema)와 대명사 해석(Anaphora Resolution) 작업에서의 도전 과제를 해결하는 것.
  • 마스크된 언어 모델과 의미 유사도 모델이 공통 지식 추론에서 상호보완적인가를 조사하는 것.
  • 공유된 BERT 인코더를 사용한 다중 작업 학습을 통해 두 가지 유형의 인도적 편향을 활용하는 하이브리드 모델을 개발하는 것.
  • 순위 손실 목표함수가 다양한 추론 작업 간의 일반화 능력을 향상시키는 데 효과적인지 검증하는 것.

제안 방법

  • HNN 모델은 두 가지 구성 요소 모델인 마스크된 언어 모델(MLM)과 심층적 의미 유사도 모델(SSM)을 통합하며, 모두 BERT 기반의 문맥 인코더를 공유한다.
  • 각 구성 요소 모델은 자신의 작업에 맞게 별도의 입력 및 출력 레이어를 사용한다: MLM은 대명사 교체 후 다음 토큰 확률을 예측하고, SSM은 대명사와 후행 어휘 후보 표현 간의 코사인 유사도를 계산한다.
  • 최종 예측은 두 모델의 점수를 가중 융합 전략을 통해 조합하여 도출된다.
  • 학습 절차는 두 단계로 구성된다: 대규모 원시 텍스트에서 BERT 인코더를 사전 학습한 후, WSCR 데이터셋에서 다중 작업 미세조정을 수행한다.
  • 정답 및 오답 후행 어휘 후보의 상대적 순서를 최적화하기 위해 순위 손실를 도입하여, 이진 분류를 초월한 일반화 능력을 향상시킨다.
  • 최종 여섯 번째 학습 에포크 동안의 모델 앙상블이 성능을 더욱 향상시키며, 특히 WNLI 벤치마크에서 두드러진 효과를 보였다.

실험 결과

연구 질문

  • RQ1마스크된 언어 모델과 의미 유사도 모델은 공통 지식 추론 작업에서 상호보완적인가?
  • RQ2두 접근 방식을 통합한 하이브리드 모델이 공통 지식 추론 벤치마크에서 개별 모델을 능가할 수 있는가?
  • RQ3학습 중 순위 손실를 포함함으로써 대명사 해석 작업 성능이 향상되는가?
  • RQ4공통 지식 추론은 순위 문제로 설정하는 것이 이진 분류 문제로 설정하는 것보다 더 나은가?
  • RQ5최종 예측에서 여러 모델 체크포인트를 앙상블함으로써 성능 향상이 얼마나 뚜렷한가?

주요 결과

  • HNN 모델은 WNLI 벤치마크에서 89.0%의 새로운 최신 기술 수준 정확도를 달성하여 이전 방법보다 5.4%p의 절대적 향상을 보였다.
  • WSC 벤치마크에서는 75.1%의 정확도를 기록하여 이전 모델을 크게 능가했다.
  • PDP60 벤치마크에서는 90.0%의 정확도를 달성하여 대명사 해석 작업으로의 일반화 능력이 뛰어나다는 것을 입증했다.
  • 제거 실험 결과, MLM 또는 SSM 구성 요소를 제거할 경우 성능에 심각한 하락이 발생하여 두 구성 요소가 상호보완적인 역할을 한다는 것을 확인했다.
  • 순위 손실는 WNLI, WSCR, WSC에서 성능 향상을 가져왔으며, 특히 WNLI에서 가장 큰 성과를 보였다(포함 시 2.3%p 절대적 향상).
  • 순위 설정 방식은 HNN 모델에서 이진 분류 방식보다 약 2.5%p 높은 정확도를 기록하여, 이 작업에 대해 순위 설정이 더 효과적인 작업 설정임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.