Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Natural Language Inference with a Pretrained Parser

Deric Pang, Lucy H. Lin|arXiv (Cornell University)|2019. 09. 18.
Topic Modeling참고 문헌 23인용 수 16
한 줄 요약

이 논문은 사전에 훈련된 관계 구문 분석기에서 추출한 문맥적 구문 구조 표현을 기존 NLI 모델에 통합함으로써 자연어 추론(NLI) 성능을 햖थ한 단순하면서도 효과적인 방법을 제안한다. 후기 융합(late fusion) 또는 주의 메커니즘을 통해 이러한 구문적 단어 표현(SWRs)을 융합함으로써, SNLI, MNLI, SciTail에서 네 가지 강력한 NLI 모델(decomposable attention, ESIM, BERT, MT-DNN)에 대해 일관되게 정확도를 향상시키며, HANS에서 최대 3.1% 향상되면서 임의의 힌트에 의존하는 경향이 감소함을 보여준다.

ABSTRACT

We introduce a novel approach to incorporate syntax into natural language inference (NLI) models. Our method uses contextual token-level vector representations from a pretrained dependency parser. Like other contextual embedders, our method is broadly applicable to any neural model. We experiment with four strong NLI models (decomposable attention model, ESIM, BERT, and MT-DNN), and show consistent benefit to accuracy across three NLI benchmarks.

연구 동기 및 목표

  • 사전에 훈련된 파서에서 유도한 구문적 구조를 통합함으로써 신경 기반 NLI 모델의 성능을 향상시키는 것.
  • 대규모 파싱 사전 훈련에서 유도된 구문 표현이 NLI에서 의미적 추론 능력을 향상시킬 수 있는지 탐색하는 것.
  • 아키텍처 수정 없이 다양한 NLI 아키텍처에 적용 가능한 일반적이고 파rameter 효율적인 방법을 개발하는 것.
  • 구문 통합이 잘못된 어휘적 및 구문적 힌트에 대한 과도한 의존도를 줄이는지, HANS 벤치마크로 측정하여 평가하는 것.

제안 방법

  • 사전에 훈련된 관계 구문 분석기의 인코더 히든 상태에서 전제와 가설에 대해 문맥 기반 토큰 수준의 벡터 표현(구문적 단어 표현, SWRs)을 추출한다.
  • 후기 융합(+LF)을 적용하여 전제와 가설의 최종 파서 표현을 분류 전에 최종 표현 벡터에 연결한다.
  • 구문적 주의 메커니즘(+SA)을 구현하여 표준 주의 계산에 SWRs를 추가함으로써 주의 점수를 의미적 표현과 구문적 표현 모두를 포함하도록 수정한다.
  • SWRs를 분해 가능한 주의, ESIM, BERT, MT-DNN의 네 가지 NLI 모델에 후기 융합(+LF) 또는 구문적 주의(+SA) 방식으로 통합하며, 모델 호환성에 따라 선택한다.
  • 기존 NLI 목표 함수를 사용해 엔드 투 엔드로 훈련하면서 사전에 훈련된 파서의 파rameters를 유지한다.
  • SNLI, MNLI, SciTail에서 성능을 평가하고, HANS 데이터셋을 사용해 힌트 의존도를 점검함으로써 모델 행동을 진단한다.

실험 결과

연구 질문

  • RQ1사전에 훈련된 파서에서 유도한 구문 표현이 다양한 신경 기반 NLI 모델의 정확도를 향상시킬 수 있는가?
  • RQ2구문 정보 통합이 모델이 잘못된 어휘적 및 구문적 힌트에 과도하게 의존하는 정도를 줄이는가?
  • RQ3후기 융합 또는 구문적 주의 메커니즘이 다양한 NLI 아키텍처에서 더 효과적인가?
  • RQ4구문 표현 통합으로 인한 성능 향상이 데이터 분포가 서로 다른 여러 NLI 벤치마크로 일반화되는가?

주요 결과

  • 제안된 방법은 SNLI, MNLI, SciTail에서 네 가지 강력한 모델(decomposable attention, ESIM, BERT, MT-DNN)에 대해 일관되게 NLI 정확도를 향상시킨다.
  • 후기 융합(+LF)은 일관된 향상을 이끌어내며, DA +SA 모델에서 SciTail 데이터셋에서 3.1%p의 절대적 성능 향상을 기록한다.
  • 구문적 주의(+SA)는 모델이 잘못된 힌트에 의존하는 정도를 줄인다: 예를 들어, BERT +LF는 HANS 전체 정확도를 50.2%에서 53.2%로 향상시키며, 포함관계와 비포함관계 레이블 간 성능 균형이 향상된다.
  • HANS 벤치마크에서 SWRs로 향상된 모델들은 포함관계와 비포함관계 사례 간 성능 격차가 크게 감소함을 보여주며, 구문적 단서를 악용하는 경향이 줄어듦을 시사한다.
  • 제거 실험 결과, +LF는 노이즈에 대해 강건한 반면, +SA는 노이즈가 추가될 경우 성능 저하를 보이며, 이는 +LF가 실질적으로 더 신뢰할 수 있음을 시사한다.
  • 이 방법은 광범위하게 적용 가능하며 최소한의 파rameters를 추가하므로, 기존 NLI 시스템에 실용적이고 효과적인 보완 조치가 된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.