Skip to main content
QUICK REVIEW

[논문 리뷰] Structural Supervision Improves Learning of Non-Local Grammatical Dependencies

Ethan Wilcox, Peng Qian|arXiv (Cornell University)|2019. 03. 03.
Natural Language Processing Techniques참고 문헌 30인용 수 4
한 줄 요약

이 논문은 구조적 지도 학습—명시적으로 계층적 문법적 구조를 모델링함—이 신경망 언어 모델이 비국소적 문법적 의존성, 예를 들어 부정성극성항목(NPI) 라이센싱과 메우기-공백 의존성 등을 학습하는 데에 기여하는지 조사한다. 통제된 심리언어학적 자극을 사용하여, 순환 신경망 문법(RNNGs)과 증분형 Parsing-as-Language-Modeling 설정이 표준 LSTMs를 능가함을 보이며, 특히 섬 제약 조건을 다룰 때 RNNG가 더 뛰어난 성능과 더 인간에 가까운 일반화를 보임을 확인한다.

ABSTRACT

State-of-the-art LSTM language models trained on large corpora learn sequential contingencies in impressive detail and have been shown to acquire a number of non-local grammatical dependencies with some success. Here we investigate whether supervision with hierarchical structure enhances learning of a range of grammatical dependencies, a question that has previously been addressed only for subject-verb agreement. Using controlled experimental methods from psycholinguistics, we compare the performance of word-based LSTM models versus two models that represent hierarchical structure and deploy it in left-to-right processing: Recurrent Neural Network Grammars (RNNGs) (Dyer et al., 2016) and a incrementalized version of the Parsing-as-Language-Modeling configuration from Chariak et al., (2016). Models are tested on a diverse range of configurations for two classes of non-local grammatical dependencies in English---Negative Polarity licensing and Filler--Gap Dependencies. Using the same training data across models, we find that structurally-supervised models outperform the LSTM, with the RNNG demonstrating best results on both types of grammatical dependencies and even learning many of the Island Constraints on the filler--gap dependency. Structural supervision thus provides data efficiency advantages over purely string-based training of neural language models in acquiring human-like generalizations about non-local grammatical dependencies.

연구 동기 및 목표

  • 구조적 지도 학습이 신경망 언어 모델에서 비국소적 문법적 의존성 학습에 기여하는지 평가하기.
  • 복잡한 문법적 의존성에 대해 표준 LSTMs, RNNGs, 그리고 증분형 Parsing-as-Language-Modeling 모델 간의 성능 비교하기.
  • 구조적 지도 학습을 통해 훈련된 모델이 순수한 순차적 모델보다 인간과 유사한 일반화, 예를 들어 섬 제약 조건 등을 더 효과적으로 학습하는지 테스트하기.
  • 구조적 지도 학습이 문법 일반화에 있어 저자료 환경에서의 데이터 효율성 향상에 기여하는 정도 평가하기.
  • RNNG와 같은 모델에서 명시적인 조합성 구조가 선형적으로 떨어진 구성요소 간의 문법적 기대치를 더 잘 전파할 수 있는지 조사하기.

제안 방법

  • 연구는 세 가지 모델을 비교한다: 256개의 은닉 유닛을 가진 2층 표준 LSTMs, 스택, 액션, 종단 처리를 위한 별도의 LSTMs를 사용하는 RNNG, 그리고 Charniak 등(2016)의 연구에서 유도된 증분형 Parsing-as-Language-Modeling 모델.
  • 모든 모델은 동일한 100만 단어의 코퍼스에서 훈련되어 모델 아키텍처 간 공정한 비교를 보장한다.
  • RNNG는 신경 스택과 액션 기반 파싱(nt, shift, reduce)을 사용하여 왼쪽에서 오른쪽으로 처리하는 동안 계층적 문법적 구조를 점진적으로 구축한다.
  • 증분형 Parsing-as-Language-Modeling 모델은 신경 스택과 출력 버퍼를 제거하고, 오직 액션 예측과 단어 생성만을 유지하여 문법적 지도 학습을 수행한다.
  • 모델 성능 평가는 NPI 라이센싱과 메우기-공백 의존성과 같은 특정 문법적 의존성을 탐지하기 위해 심리언어학적으로 통제된 자극을 사용하여 평가된다.
  • 시험은 문법적과 비문법적 계속 문장의 확률 순위를 통한 수용 가능성 판단을 포함하며, 라이센싱 상호작용의 통계적 유의성은 검증된다.

실험 결과

연구 질문

  • RQ1구조적 지도 학습이 부정성극성항목(NPI) 라이센싱과 같은 비국소적 문법적 의존성 학습에 기여하는가?
  • RQ2RNNG와 증분형 Parsing-as-Language-Modeling과 같은 구조적 지도 학습 모델이 표준 LSTMs보다 메우기-공백 의존성을 더 잘 포착할 수 있는가?
  • RQ3구조적 지도 학습 모델이 예를 들어 섬 제약 조건과 같은 인간에 가까운 일반화를 예측에서 더 잘 보여주는가?
  • RQ4구조적 지도 학습이 복잡한 문법적 의존성 학습에서 데이터 효율성을 얼마나 향상시키는가?
  • RQ5명시적인 조합성(예: RNNG)을 가진 모델이 선형적으로 떨어져 있지만 문법적으로 국소적인 구성요소 간의 문법적 기대치를 더 잘 유지하는가?

주요 결과

  • RNNG는 강한 라이센싱 상호작용이 예상되는 13개의 메우기-공백 의존성 테스트 중 8개에서 표준 LSTM을 뛰어넘는 성능을 보였다.
  • ActionLSTM은 이러한 테스트 중 5개에서 LSTM을 뛰어넘는 성능을 보였으며, 이는 문법적 지도 학습의 유의미한 이점임을 시사한다.
  • RNNG는 트리 기반으로 국소적인 맥락에서 가장 강한 wh-라이센싱 효과를 보였으며, 이는 메우기 기대치를 더 잘 유지하고 있음을 시사한다.
  • RNNG와 ActionLSTM 모두 주어 수식어인 전치사구(섬 조건)에 대해 라이센싱 상호작용의 유의미한 감소를 보였으며, RNNG의 p < 0.001, ActionLSTM의 p < 0.01로 유의미했다.
  • LSTM은 주어 수식어와 목적어 수식어 전치사구를 구분하지 못했으며, 주어 섬에서 wh-추출을 잘못 라이센싱했다.
  • 구조적 지도 학습은 대용량 데이터를 가진 LSTMs조차도 능가하는 NPI 라이센싱 학습을 가능하게 하여 데이터 효율성의 이점을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.