[논문 리뷰] What Syntactic Structures block Dependencies in RNN Language Models?
이 논문은 RNN 언어 모델이 복잡한 문법적 구조를 통해 문장 간격 의존성과 성격 일치 기대를 유지할 수 있는지 여부를 테스트하여 문법적 섬 제약 조건을 학습하는지 조사한다. 통제된 실험을 통해 저자들은 최첨단 LSTMs가 왼쪽 분기 섬과 협조 섬 제약 조건을 점진적으로 학습하지만, 문장 주어 섬 제약 조건은 학습하지 못함을 보여주며, 순수한 문법적 복잡성 초과하여 계층적 문법적 구조에 민감함을 보임을 입증한다.
Recurrent Neural Networks (RNNs) trained on a language modeling task have been shown to acquire a number of non-local grammatical dependencies with some success. Here, we provide new evidence that RNN language models are sensitive to hierarchical syntactic structure by investigating the filler--gap dependency and constraints on it, known as syntactic islands. Previous work is inconclusive about whether RNNs learn to attenuate their expectations for gaps in island constructions in particular or in any sufficiently complex syntactic environment. This paper gives new evidence for the former by providing control studies that have been lacking so far. We demonstrate that two state-of-the-art RNN models are are able to maintain the filler--gap dependency through unbounded sentential embeddings and are also sensitive to the hierarchical relationship between the filler and the gap. Next, we demonstrate that the models are able to maintain possessive pronoun gender expectations through island constructions---this control case rules out the possibility that island constructions block all information flow in these networks. We also evaluate three untested islands constraints: coordination islands, left branch islands, and sentential subject islands. Models are able to learn left branch islands and learn coordination islands gradiently, but fail to learn sentential subject islands. Through these controls and new tests, we provide evidence that model behavior is due to finer-grained expectations than gross syntactic complexity, but also that the models are conspicuously un-humanlike in some of their performance characteristics.
연구 동기 및 목표
- RNN 언어 모델이 문법적 섬 제약 조건을 학습하는지 아니면 단지 문법적 복잡성에 민감한지 판단하는 것.
- 모델이 섬 구조를 통해 문장 간격 의존성과 성격 일치 기대를 유지할 수 있는지 테스트하는 것.
- 협조 섬, 왼쪽 분기 섬, 문장 주어 섬과 같이 이전에 테스트되지 않은 섬 제약 조건에 대한 모델의 민감도를 평가하는 것.
- RNN 행동에서 일반적인 문법적 복잡성 효과와 세밀한 문법적 구조 민감도를 구분하는 것.
제안 방법
- 문장 간격 의존성과 성격 일치 기대를 포함한 통제된 문장 쌍을 설계하였으며, 섬 구조만 다를 뿐이다.
- 두 개의 최첨단 LSTM 언어 모델(Google 및 Gulordava)을 사용하여 섬 조건과 비섬 조건 간의 확률 차이를 측정하였다.
- 문장 간격 의존성의 감소와 성격 기대 감소를 문법 민감도의 지표로 측정하였다.
- 무한대 문장 내장 구조를 통해 의존성 유지 능력을 테스트하기 위해 비무한한 문장 내장에 대한 실험을 수행하였다.
- 네 가지 섬 유형(wh-섬, 복합 명사구 섬, 부사어 섬)과 세 가지 새로운 유형(협조, 왼쪽 분기, 문장 주어)에 대해 모델을 평가하였다.
- 통계적 검정(p < 0.01, p < 0.05 등)을 적용하여 제어 조건과 섬 조건 간 모델 반응의 유의성 차이를 평가하였다.
실험 결과
연구 질문
- RQ1RNN 언어 모델은 문법적 섬 내에서 간격 기대를 약화시키는가, 아니면 일반적인 문법적 복잡성 때문인가?
- RQ2RNN은 비무한한 문장 내장 구조를 통해 문장 간격 의존성을 유지할 수 있는가?
- RQ3RNN은 문법적 섬 제약 조건을 통해 계층적 문법적 구조에 민감한가, 아니면 구조적 복잡성과 비구조적 복잡성의 차이를 인지하지 못하는가?
- RQ4RNN은 왼쪽 분기 섬, 협조 섬, 문장 주어 섬 제약 조건을 각각 다른 정도로 학습하는가?
주요 결과
- Google 및 Gulordava 모델은 비무한한 문장 내장 구조를 통해 문장 간격 의존성을 유지하였으며, 이는 장거리 의존성 학습 능력이 뛰어남을 시사한다.
- 왼쪽 분기 섬 조건에서 wh-허용성 상호작용이 유의미하게 감소함(p < 0.001 for Google, p < 0.05 for Gulordava)을 보여, 왼쪽 분기 섬 제약 조건을 학습함을 나타낸다.
- 협조 섬에 대해 점진적인 학습을 보였으며, 부분적인 민감도는 있으나 기대 감소가 완전히 이루어지지는 않았다.
- 모든 모델에서 문장 주어 섬에 대해 wh-허용성 또는 성격 기대 감소가 유의미하게 관찰되지 않아, 이 제약 조건을 학습하지 못함을 나타낸다.
- 모든 섬 유형에서 성격 일치 기대가 그대로 유지되었으며, 일반적인 정보 흐름 차단을 배제하고 세밀한 문법 민감도를 지지한다.
- 모델들은 일곱 가지 섬 제약 조건 중 다섯 가지(또는 Gulordava 모델의 경우 여섯 가지)를 학습하였으며, 일반적인 복잡성보다는 계층적 문법적 구조에 대한 선택적 민감도를 보임을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.