Skip to main content
QUICK REVIEW

[논문 리뷰] Neural Polysynthetic Language Modelling

Lane Schwartz, Francis M. Tyers|arXiv (Cornell University)|2020. 05. 11.
Natural Language Processing Techniques참고 문헌 74인용 수 13
한 줄 요약

이 논문은 유창성 언어인 이누크티투트, 유피크, 구아라니와 같은 다형어 언어의 극도로 복잡한 형태소 구조를 다루기 위해 유한 상태 형태소 분석기와 텐서 곱 표현(TPR)을 통합한 새로운 신경 언어 모델링 프레임워크를 제안한다. 언어학적으로 타당한 형태소 수준의 분할과 맞춤형 해체 손실 함수를 사용함으로써, 표준 서브워드 또는 문자 수준의 방법에 비해 자원이 제한된 고형태어 언어에서 언어 모델링 성능을 크게 향상시킨다.

ABSTRACT

Research in natural language processing commonly assumes that approaches that work well for English and and other widely-used languages are "language agnostic". In high-resource languages, especially those that are analytic, a common approach is to treat morphologically-distinct variants of a common root as completely independent word types. This assumes, that there are limited morphological inflections per root, and that the majority will appear in a large enough corpus, so that the model can adequately learn statistics about each form. Approaches like stemming, lemmatization, or subword segmentation are often used when either of those assumptions do not hold, particularly in the case of synthetic languages like Spanish or Russian that have more inflection than English. In the literature, languages like Finnish or Turkish are held up as extreme examples of complexity that challenge common modelling assumptions. Yet, when considering all of the world's languages, Finnish and Turkish are closer to the average case. When we consider polysynthetic languages (those at the extreme of morphological complexity), approaches like stemming, lemmatization, or subword modelling may not suffice. These languages have very high numbers of hapax legomena, showing the need for appropriate morphological handling of words, without which it is not possible for a model to capture enough word statistics. We examine the current state-of-the-art in language modelling, machine translation, and text prediction for four polysynthetic languages: Guaraní, St. Lawrence Island Yupik, Central Alaskan Yupik, and Inuktitut. We then propose a novel framework for language modelling that combines knowledge representations from finite-state morphological analyzers with Tensor Product Representations in order to enable neural language models capable of handling the full range of typologically variant languages.

연구 동기 및 목표

  • 극도로 변화가 많고 자원이 제한된 다형어 언어의 극도로 복잡한 형태소 구조를 다루는 데 도전하는 것.
  • 표준 서브워드 분할(예: BPE, Morfessor) 및 문자 수준 모델이 자원이 제한된 언어에서 풍부한 형태소 구조를 포착하는 데 한계가 있음을 극복하는 것.
  • 유한 상태 형태소 분석기에서 유래한 언어학적 지식을 통합하여 일반화 능력과 표현 학습 능력을 향상시키는 신경 언어 모델링 프레임워크를 개발하는 것.
  • 이종 다형어 언어를 위한 실용적인 모바일 장치 내 구동 가능한 형태소 인식 예측 텍스트 시스템을 통해 언어 모델의 실질적 구현을 가능하게 하는 것.
  • 예측된 형태소 수준 표현을 기준 형태소 구조와 일치시키기 위한 새로운 미분 가능한 손실 함수(해체 손실)를 제안하는 것.

제안 방법

  • 다형어 언어의 단어를 형태소로 명시적이고 언어학적으로 타당한 분할을 제공하기 위해 유한 상태 형태소 분석기(FST)를 통합한다.
  • 각 형태소를 텐서 곱 표현(TPR)을 사용한 분산 텐서로 표현함으로써 복잡한 어형을 조합적으로 모델링할 수 있도록 한다.
  • 예측된 TPR 텐서가 기준 형태소 표현과 일치하도록 하는 새로운 해체 손실 함수를 사용하여 형태소 수준 토큰을 입력으로 사용하는 순환 신경망(RNN) 언어 모델을 훈련시킨다.
  • 퍼플렉서티를 주요 평가 지표로 사용하여, 문자, BPE, Morfessor, FST 기반 분할의 네 가지 분할 방법 간 성능을 비교한다.
  • 어형 경계를 고려한 문자 수준 RNN을 사용하여 장치 내 언어 모델을 개발하고, 예측 단위를 전체 어형이 아닌 형태소 기반으로 설정하여 긴 희귀 어형을 처리한다.
  • 유사한 다형어 언어(예: 이누크티투트)의 데이터를 활용해 다국어 전이 학습을 통해 자원이 제한된 환경에서 기계 번역 품질을 향상시킨다.

실험 결과

연구 질문

  • RQ1유한 상태 형태소 분석기에서 유래한 언어학적 지식을 통합한 신경 언어 모델이, 극도로 변화가 많고 자원이 제한된 다형어 언어에서 표준 서브워드 또는 문자 수준 모델보다 우수한 성능을 보일 수 있는가?
  • RQ2TPR를 사용한 형태소 수준 모델링이, 희귀어가 많고 자료가 제한된 언어에서 일반화 능력과 표현 학습 능력을 어떻게 향상시키는가?
  • RQ3유사한 다형어 언어에서의 전이 학습이 자원이 제한된 환경에서 기계 번역 품질을 얼마나 향상시킬 수 있는가?
  • RQ4희귀어가 많고 매우 긴 어형을 포함한 멸종 위험에 처한 언어를 위한 형태소 인식 언어 모델을 모바일 장치에 구현하는 데 직면한 실질적 과제는 무엇인가?
  • RQ5제안된 해체 손실 함수가 예측된 형태소 텐서를 기준 언어학적 구조와 얼마나 잘 일치시키는가?

주요 결과

  • FST 기반 분할 방법이 다형어 언어에서 가장 낮은 퍼플렉서티를 기록하여 문자, BPE, Morfessor 방법보다 뛰어난 성능을 보였으며, 형태소 복잡성을 다루기 위해 언어학적으로 타당한 분할이 필수적임을 시사한다.
  • 구아라니어와 세인트 로렌스 섬 유피크어의 장치 내 키보드에서 형태소 수준 예측이 긴 희귀어형을 효과적으로 처리했으며, 이는 전체 어형 후보로 나열하는 데는 비실용적인 상황을 해결했다.
  • 해체 손실을 통한 TPR 기반 프레임워크는 예측된 형태소 표현을 기준 구조와 효과적으로 일치시켰으며, 복잡한 어형의 조합적 모델링을 지원했다.
  • 다형어 언어에서 어형 수준 언어 모델링 성능는 문자 수준에 비해 뚜렷이 열 劣했으며, 자원이 제한된 환경에서 전체 어형을 모델링하는 데의 어려움을 보여주었다.
  • 유사한 다형어 언어(예: 이누크티투트)에서의 전이 학습은 대규모 단일 언어 코퍼스가 없이도 자원이 제한된 언어인 센트럴 알라스카 유프익 및 세인트 로렌스 섬 유피크어의 기계 번역 품질을 향상시켰다.
  • 본 연구는 구아라니어와 세인트 로렌스 섬 유피크어에 대해 세계 최초로 기능하는 장치 내 예측 텍스트 시스템을 구현했으며, 멸종 위험에 처한 언어 환경에서 신경 언어 모델의 실질적 구현 가능성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.