Skip to main content
QUICK REVIEW

[논문 리뷰] Syntax-Aware Language Modeling with Recurrent Neural Networks

Duncan A. J. Blythe, Alan Akbik|arXiv (Cornell University)|2018. 03. 02.
Natural Language Processing Techniques참고 문헌 19인용 수 3
한 줄 요약

이 논문은 문법적 특징—예를 들어 품사 태그—를 문자 수준의 RNN 언어 모델에 통합하기 위해 토큰에 문법 레이블을 접두어로 붙이는 Syntax-Aware Language Models(SALMs)를 제안한다. SYNSIR라고 하는 순차적 몬테 카를로 방법을 사용하여 SALMs는 분석되지 않은 텍스트에 대해 가능성이 높은 문법적 구조를 추론할 수 있으며, 이는 문자 수준의 모델링에서 퍼즐러피티를 크게 감소시키지만, 단어 수준에서는 표준 모델과 동등한 성능을 유지한다.

ABSTRACT

Neural language models (LMs) are typically trained using only lexical features, such as surface forms of words. In this paper, we argue this deprives the LM of crucial syntactic signals that can be detected at high confidence using existing parsers. We present a simple but highly effective approach for training neural LMs using both lexical and syntactic information, and a novel approach for applying such LMs to unparsed text using sequential Monte Carlo sampling. In experiments on a range of corpora and corpus sizes, we show our approach consistently outperforms standard lexical LMs in character-level language modeling; on the other hand, for word-level models the models are on a par with standard language models. These results indicate potential for expanding LMs beyond lexical surface features to higher-level NLP features for character-level models.

연구 동기 및 목표

  • 명시적인 문법적 특징을 통합함으로써 신경망 언어 모델 성능이 향상되는지 조사하는 것.
  • 분석되지 않은 실제 텍스트에 문법 보강 언어 모델을 적용하는 데 도전하는 것.
  • 사전에 분석된 입력이 필요 없이 추론 도중에 문법적 구조를 추론할 수 있는 방법을 개발하는 것.
  • 문법 인식 모델링이 문자 수준과 단어 수준 언어 모델링에 미치는 영향을 평가하는 것.
  • 문법 정보가 저수준 언어 모델링에서 일반화 능력과 데이터 효율성을 향상시킬 수 있음을 보여주는 것.

제안 방법

  • 논문은 각 문장을 각 토큰이 그 문법 태그로 접두된 순서로 변환함으로써 SALMs를 도입한다 (예: 'look' 대신 'NOUN-look'으로).
  • 모델는 이러한 문법 태그가 입력 토큰의 일부로 간주되는 문법 태그가 부여된 시퀀스를 기반으로 표준 문자 수준의 LSTM 언어 모델로 훈련된다.
  • 추론 도중에 분석되지 않은 텍스트 조각에 대해 가장 가능성이 높은 문법 접두사 분포를 추정하기 위해 새로운 순차적 몬테 카를로 추론 알고리즘인 SYNSIR를 제안한다.
  • SYNSIR는 들어오는 문자 시퀀스에 기반해 문법 접두사를 온라인 리샘플링하여 입력이 길어짐에 따라 문법적 불확실성을 동적으로 업데이트한다.
  • 입력의 부분적 결과에 기반해 문법 접두사에 대한 사후 분포를 추정하기 위해 입자 기반 접근법을 사용하며, 이는 불확실성 하에서 점수 평가나 생성을 가능하게 한다.
  • 퍼즐러피티를 주요 평가 지표로 사용하여 여러 코퍼스와 샘플 크기에서 표준 LSTM 언어 모델과의 비교를 통해 방법을 평가한다.

실험 결과

연구 질문

  • RQ1명시적인 문법적 특징이 문자 수준의 신경망 언어 모델 성능을 향상시킬 수 있는가?
  • RQ2문법적 구조가 추론 시점에 제공되지 않는 분석되지 않은 텍스트에 대해 문법 인식 언어 모델을 어떻게 적용할 수 있는가?
  • RQ3문법을 통합하면 언어 모델링에서 더 나은 일반화나 데이터 효율성을 달성할 수 있는가?
  • RQ4왜 문법 인식 모델은 문자 수준에서는 성능 향상을 보이지만 단어 수준에서는 그렇지 않은가?
  • RQ5모델은 새로운 텍스트가 처리됨에 따라 동적으로 문법적 구조를 추론하고 업데이트할 수 있는가?

주요 결과

  • SALMs는 모든 테스트 코퍼스와 샘플 크기에서 표준 LSTM 언어 모델보다 문자 수준 모델링에서 퍼즐러피티를 크게 감소시킨다.
  • 퍼즐러피티 감소는 일관되고 통계적으로 의미 있는 것으로, 이는 문법 정보가 문자 수준에서 일반화 능력과 데이터 효율성을 향상시킨다는 것을 시사한다.
  • 단어 수준에서는 SALMs가 표준 언어 모델과 동등한 성능을 보이며, 이는 단어 수준 모델이 명시적 지도 없이도 문법 패턴을 암묵적으로 학습할 수 있음을 시사한다.
  • SYNSIR는 온라인에서 문법적 구조를 성공적으로 추론하고 업데이트한다: 예를 들어, 입력이 더해질수록 'display'를 명사에서 동사로 전환한다.
  • 모델는 새로운 문자가 처리됨에 따라 문법 접두사에 대한 사후 확률이 실시간으로 업데이트되는 동적 문법 추론 능력을 보인다.
  • 결과는 문법 인식 모델링이 특히 데이터가 제한된 경우에 저수준 언어 모델링 향상에 강력한 잠재력을 지닌다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.