Skip to main content
QUICK REVIEW

[논문 리뷰] Integrating Linguistic Theory and Neural Language Models

Bai Li|arXiv (Cornell University)|2022. 07. 20.
Natural Language Processing Techniques인용 수 4
한 줄 요약

이 학위논문은 다국어 BERT를 사용하여 어휘 금형의 탄력성에서의 의미 거리 측정, 모조어법적 이상 징후를 의미 이상보다 이르게 탐지하기 위한 가우시안 기반의 놀라움 측정 방법 도입, 그리고 언어 모델이 문장 구성 구조를 어떻게 내재화하는지 보여주기 위해 심리언어학적 연구를 적응 적용함으로써 언어 이론과 신경망 언어 모델 간의 상호 이득을 입증한다. 주요 기여는 이론에 기반한 체계적인 탐색 방법을 수립하여 신경망 모델이 언어 현상들을 어떻게 내재화하는지를 드러내는 데 있다.

ABSTRACT

Transformer-based language models have recently achieved remarkable results in many natural language tasks. However, performance on leaderboards is generally achieved by leveraging massive amounts of training data, and rarely by encoding explicit linguistic knowledge into neural models. This has led many to question the relevance of linguistics for modern natural language processing. In this dissertation, I present several case studies to illustrate how theoretical linguistics and neural language models are still relevant to each other. First, language models are useful to linguists by providing an objective tool to measure semantic distance, which is difficult to do using traditional methods. On the other hand, linguistic theory contributes to language modelling research by providing frameworks and sources of data to probe our language models for specific aspects of language understanding. This thesis contributes three studies that explore different aspects of the syntax-semantics interface in language models. In the first part of my thesis, I apply language models to the problem of word class flexibility. Using mBERT as a source of semantic distance measurements, I present evidence in favour of analyzing word class flexibility as a directional process. In the second part of my thesis, I propose a method to measure surprisal at intermediate layers of language models. My experiments show that sentences containing morphosyntactic anomalies trigger surprisals earlier in language models than semantic and commonsense anomalies. Finally, in the third part of my thesis, I adapt several psycholinguistic studies to show that language models contain knowledge of argument structure constructions. In summary, my thesis develops new connections between natural language processing, linguistic theory, and psycholinguistics to provide fresh perspectives for the interpretation of language models.

연구 동기 및 목표

  • 신경망 언어 모델이 어휘 금형과 같은 언어 현상에서의 의미 거리 측정을 위한 객관적 도구로 기능할 수 있는지 조사하기 위해.
  • 중간 계층에서의 놀라움 측정을 위한 가우시안 밀도 추정 방법을 개발하여 언어적 이상 징후를 탐지하기 위해.
  • 구조 문법 이론에서의 문장 구성 구조 지식을 언어 모델이 내재화하고 있는지 평가하기 위해 심리언어학적 실험을 적응 적용하기 위해.
  • 언어 이론이 탐색 방법을 이끌 수 있음을 입증하여 신경망 언어 모델 분석의 해석 가능성과 관련성을 향상시키기 위해.
  • 이론적 언어학, 심리언어학, 자연어 처리를 통합하기 위한 프레임워크를 수립하기 위해.

제안 방법

  • 어휘 금형의 방향성 과정으로서의 특성을 평가하기 위해, 다국어 BERT를 사용하여 다국어 어휘 쌍 간의 의미 유사도 점수를 계산하였다.
  • 중간 트랜스포머 계층에서의 놀라움을 계산하기 위해 가우시안 기반의 밀도 추정 방법을 제안하여 계층별 이상 징후 탐지가 가능하도록 하였다.
  • 모조어법적, 의미적, 일반 지식 기반의 세 가지 유형의 언어적 이상에 대해, 정제된 데이터셋을 사용하여 놀라움 방법을 적용하였다.
  • 특히 N400 및 프라밍 연구를 포함한 심리언어학적 범주를 탐색 작업으로 적응 적용하여 언어 모델이 문장 구성 구조를 어떻게 처리하는지 평가하였다.
  • 컨텍스트 임베딩의 계층별 탐색을 수행하여 트랜스포머 모델의 순방향 전파 과정에서 언어적 특징이 어떻게 나타나는지 분석하였다.
  • 아블레이션 연구와 모델 비교(예: RoBERTa 대 XLNet)를 통해 아키텍처의 차이와 데이터 분포에 대한 민감도를 평가하였다.

실험 결과

연구 질문

  • RQ1mBERT와 같은 언어 모델이 어휘 금형과 같은 언어 현상에서 의미 거리 측정을 위한 객관적이고 다국어적으로 일관된 도구로 기능할 수 있는가? 이는 어휘 금형의 방향성 분석을 뒷받침하는가?
  • RQ2언어 모델이 모조어법적 이상 징후를 의미적 또는 일반 지식 기반 이상 징후보다 먼저 감지하는 계층은 어디이며, 이는 내부 처리 방식에 대해 무엇을 드러내는가?
  • RQ3언어 모델은 인간의 심리언어학적 연구 결과와 유사한 문장 구성 구조 지식을 보여주는가?
  • RQ4언어 모델의 아키텍처적 차이(예: RoBERTa 대 XLNet)가 다양한 유형의 언어적 이상 징후에 대한 민감도에 영향을 미치는가?
  • RQ5심리언어학적 범주를 효과적으로 적응하여 신경망 언어 모델을 특정 언어 현상에 대해 탐색할 수 있는가?

주요 결과

  • mBERT는 어휘 금형의 방향성 패턴을 성공적으로 식별하여, 전환 과정에서의 의미 이동이 언어 간으로 비대칭적이고 방향적임을 지지하는 증거를 제공하였다.
  • 모조어법적 이상 징후는 의미적 또는 일반 지식 기반 이상 징후보다 네트워크의 초기 계층(예: 하위 계층)에서 더 높은 놀라움을 유발하여, 문법 위반에 대한 조기 민감도를 나타내었다.
  • 언어 모델은 문장 구성 구조 탐색에 대해 강력한 반응을 보였으며, 프라밍 효과 및 N400 유사 반응과 같은 핵심 심리언어학적 발견을 재현하였다.
  • 가우시안 기반의 놀라움 방법은 표준 마스킹 언어 모델링보다 이상 징후를 더 이르고 일관되게 탐지하였으며, 특히 모조어법적 오류에 유리하였다.
  • 아키텍처적 차이는 이상 징후 탐지에 상당한 영향을 미쳤다: RoBERTa에서는 이상 유형 간의 구분이 XLNet보다 더 명확하게 나타났다. 이는 모델 아키텍처가 언어 민감도에 영향을 미칠 수 있음을 시사한다.
  • 다양한 언어와 데이터셋을 통해 탐색 결과가 안정되었으며, 이는 언어 지식이 통합 임베딩에 체계적으로 내재되어 있으며 단지 통계적 패턴이 아니라는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.