Skip to main content
QUICK REVIEW

[논문 리뷰] Several Experiments on Investigating Pretraining and Knowledge-Enhanced Models for Natural Language Inference

Tianda Li, Xiaodan Zhu|arXiv (Cornell University)|2019. 04. 27.
Natural Language Processing Techniques인용 수 9
한 줄 요약

이 논문은 비지도 사전학습 및 인간이 주석을付けた 자원으로부터의 외부 지식이 자연어 추론(NLI) 성능에 미치는 영향을 조사한다. BERT 및 유사 모델이 대규모 텍스트에서 동의어, 하위관계어 등 유용한 추론 의미를 학습하는 반면, WordNet 기반 지식 강화 모델(KIM)은 반대어, 동하위관계어 등 어휘 관계를 포착한다. 주요 발견은 두 접근 방식이 상호 보완적이라는 점이며, BERT는 도메인 내 데이터에서 KIM를 능가하지만, 사전학습 과정에서 학습되지 않은 명시적 어휘 지식이 필요한 경우 KIM가 뛰어난 성능을 보인다.

ABSTRACT

Natural language inference (NLI) is among the most challenging tasks in natural language understanding. Recent work on unsupervised pretraining that leverages unsupervised signals such as language-model and sentence prediction objectives has shown to be very effective on a wide range of NLP problems. It would still be desirable to further understand how it helps NLI; e.g., if it learns artifacts in data annotation or instead learn true inference knowledge. In addition, external knowledge that does not exist in the limited amount of NLI training data may be added to NLI models in two typical ways, e.g., from human-created resources or an unsupervised pretraining paradigm. We runs several experiments here to investigate whether they help NLI in the same way, and if not,how?

연구 동기 및 목표

  • 비지도 사전학습 모델(BERT 등)이 NLI 데이터셋의 데이터 아티팩트를 악용하는 것이 아니라 진정한 추론 의미를 학습하는지 조사하기 위해
  • WordNet과 같은 인간 주석 어휘 자원을 사용하는 지식 강화 모델(KIM)의 NLI 성능에 대한 효과를 평가하기 위해
  • SNLI 및 MultiNLI와 같은 도메인 내 및 도메인 외 NLI 벤치마크에서 사전학습 기반 모델(BERT, GPT 등)과 지식 강화 모델(KIM)의 성능을 비교하기 위해
  • 한 모델이 다른 모델보다 우수한 경우의 문장 쌍을 분석하여 각 접근 방식이 언제 성공하거나 실패하는지 밝혀내기 위해
  • 사전학습과 외부 지식을 조합하여 NLI 일반화 성능을 향상시킬 잠재력을 탐색하기 위해

제안 방법

  • 저자는 SNLI 및 MultiNLI 데이터셋에서 BERT, GPT 및 여러 기준 모델(ESIM, DenseNet+DynAtt)을 미세조정한다.
  • 저자는 WordNet에서 유래한 어휘 관계(동의어, 반대어, 하위관계어 포함)를 NLI 예측 과정에 통합하는 지식 강화 모델(KIM)을 훈련시킨다.
  • 모델의 강건성과 데이터 아티팩트 의존도를 검출하기 위해 스위핑 평가 방법과 스트레스 테스트 데이터셋(Glockner 및 Naik)을 적용한다.
  • 한 모델은 정확하고 다른 모델은 오류를 내는 문장 쌍에 대한 사례 연구를 수행하여, 예측에서 어휘 쌍 관계의 역할을 분석한다.
  • 도메인 내(SNLI, MultiNLI) 및 도메인 외 테스트 세트에서의 모델 성능을 비교하여 일반화 능력을 평가한다.
  • BERT와 KIM의 예측을 조합하는 오라클 모델을 사용하여 모델 앙상블의 잠재적 성과 향상을 평가한다.

실험 결과

연구 질문

  • RQ1비지도 사전학습(BERT 등)이 NLI 데이터셋의 주석 아티팩트를 악용하는 것이 아니라 진정한 추론 의미를 학습하는가?
  • RQ2WordNet 기반 어휘 관계를 사용하는 지식 강화 모델(KIM)은 사전학습 기반 모델에 비해 NLI 성능에서 어떻게 비교되는가?
  • RQ3어떤 종류의 NLI 예제에서 KIM이 BERT를 능가하고, 반대로 BERT가 KIM를 능가하는가?
  • RQ4사전학습 기반 모델과 지식 강화 모델은 서로 다른 종류의 추론 지식을 포착하는 데서 상호 보완적인가?
  • RQ5사전학습과 외부 지식을 조합하면 도메인 외부 데이터에서의 NLI 일반화 성능을 향상시킬 수 있는가?

주요 결과

  • BERT는 도메인 내 NLI 벤치마크(SNLI 및 MultiNLI)에서 KIM보다 높은 성능을 기록하며 개별 성능으로서 최고를 기록한다.
  • KIM은 WordNet에 기록된 반대어, 동의어 등 명시적 어휘 지식이 필요한 예제에서 BERT보다 더 정확하다.
  • BERT는 정확하고 KIM은 잘못된 경우, 어휘 쌍 관계(예: 'sun-lit' 대비 'moon-lit')가 WordNet에 존재하지 않지만, 대규모 문장 코퍼스에서의 사전학습을 통해 학습된 경우가 많다.
  • KIM는 정확하고 BERT는 잘못된 경우, 필요한 어휘 쌍 관계(예: 'sun-lit' 대비 'moon-lit')가 WordNet에 존재하여 KIM이 구조화된 어휘 지식을 효과적으로 활용하고 있음을 보여준다.
  • 두 모델의 성능은 도메인 외부 테스트 세트에서 모두 저하되지만, BERT가 KIM를 앞서는 상대적 순위는 일관되게 유지된다.
  • BERT와 KIM을 조합한 오라클 모델은 개별적으로 사용할 경우보다 높은 성능을 기록하여, 두 접근 방식이 서로 보완적임을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.