Skip to main content
QUICK REVIEW

[논문 리뷰] Morfessor EM+Prune: Improved Subword Segmentation with Expectation Maximization and Pruning

Stig-Arne Grönroos, Sámi Virpioja|arXiv (Cornell University)|2020. 03. 06.
Natural Language Processing Techniques인용 수 14
한 줄 요약

이 논문은 기대값 최대화(EM)와 반복적 제거를 사용한 모르페서 기본 모델의 향상된 학습 알고리즘인 Morfessor EM+Prune을 제안한다. 이 알고리즘은 영어, 핀란드어, 터키어에서 더 나은 최적화와 높은 형태소 분할 정확도를 달성하며, 특정 초모수 설정 하에서 SentencePiece 서브워드 분할 방법과 동등한 성능을 보이며, Morfessor 툴킷에 오픈소스 구현체를 공개하였다.

ABSTRACT

Data-driven segmentation of words into subword units has been used in various natural language processing applications such as automatic speech recognition and statistical machine translation for almost 20 years. Recently it has became more widely adopted, as models based on deep neural networks often benefit from subword units even for morphologically simpler languages. In this paper, we discuss and compare training algorithms for a unigram subword model, based on the Expectation Maximization algorithm and lexicon pruning. Using English, Finnish, North Sami, and Turkish data sets, we show that this approach is able to find better solutions to the optimization problem defined by the Morfessor Baseline model than its original recursive training algorithm. The improved optimization also leads to higher morphological segmentation accuracy when compared to a linguistic gold standard. We publish implementations of the new algorithms in the widely-used Morfessor software package.

연구 동기 및 목표

  • 모르페서 기본 모델의 학습 알고리즘을 향상시켜 검색 오차를 감소시키고 분할 품질을 향상시키는 것.
  • 모르페서 EM+Prune, 그레디 유니그램 우도, SentencePiece, 모르페서 기본 모델을 포함한 여러 유니그램 기반 서브워드 분할 방법을 비교하는 것.
  • 제안된 EM+Prune 알고리즘이 원래의 재귀적 학습 방법에 비해 더 높은 형태소 분할 정확도를 달성하는지 보여주는 것.
  • 특정 초모수 설정 하에서 모르페서 EM+Prune가 SentencePiece 서브워드 분할 행동을 재현하는지 보여주는 것.
  • 새로운 알고리즘의 오픈소스 구현체를 널리 사용되는 모르페서 소프트웨어 패키지에 통합하여 보급성과 재현 가능성을 높이는 것.

제안 방법

  • 모르페서 기본 모델의 목적 함수 최적화를 위해 수정된 초기화와 반복적 제거를 적용한 기대값 최대화(EM) 알고리즘을 채택한다.
  • 서브워드 단위 발견을 정규화하기 위해 최소 기술 길이(MDL)와 딜리클레 과정(DP) 사전을 조합한 이중 사전 기반 메커니즘을 도입한다.
  • 제거 후 단일 EM 반복을 수행하는 후기-EM 변형을 사용하여 수렴성을 향상시키고 국소 최적해를 줄인다.
  • 희귀 서브워드 단위의 확률 추정을 안정화하기 위해 빈도 감쇠 기법을 적용한다.
  • 학습 중 다양한 분할 가설을 탐색하기 위해 N-가장 좋은 디코딩과 샘플링 디코딩을 활용한다.
  • 과적합을 방지하고 학습 효율을 향상시키기 위해 비용 변화 임계값 기반 정지 기준을 구현한다.

실험 결과

연구 질문

  • RQ1모르페서 기본 모델의 원래 재귀적 학습 방식에 비해 EM+Prune 알고리즘이 검색 오차를 크게 감소시키고 분할 품질을 향상시키는가?
  • RQ2형태소 분할 정확도 측면에서 모르페서 EM+Prune는 그레디 유니그램 우도 및 원래 모르페서 기본 모델과 비교해 어떻게 성능을 내는가?
  • RQ3모르페서 EM+Prune가 SentencePiece 서브워드 분할 방법의 행동을 재현하는 데 필요한 초모수 설정은 무엇인가?
  • RQ4MDL에 더해 DP 사전을 포함시키면 자원이 적거나 형태소가 풍부한 언어에서 서브워드 단위 발견에 얼마나 기여하는가?
  • RQ5제안된 알고리즘이 사전 토크나이제이션 또는 언어학적 자원 없이 기존 NLP 파이프라인에 효과적으로 통합될 수 있는가?

주요 결과

  • Morfessor EM+Prune는 학습 중 검색 오차를 감소시키며, 영어, 핀란드어, 터키어에서 원래 모르페서 기본 모델에 비해 더 높은 형태소 분할 정확도를 달성한다.
  • 특히 형태소가 풍부한 언어에서, 그레디 유니그램 우도 및 원래 모르페서 기본 모델에 비해 분할 품질 측면에서 뛰어난 성능을 보인다.
  • 특정 초모수 설정 하에서 모르페서 EM+Prune는 SentencePiece 참조 구현체와 동일한 서브워드 분할 결과를 생성하여, 상호 운용성과 강건성을 입증한다.
  • 비용 함수에 MDL과 DP 사전을 모두 포함시키면, 특히 자원이 적은 환경에서 더 안정적이고 언어학적으로 타당한 서브워드 단위가 도출된다.
  • Morfessor EM+Prune의 오픈소스 구현체가 모르페서 소프트웨어 패키지에 공개되어, NLP 연구 및 응용 분야에서의 보편적 보급과 재현 가능성을 높였다.
  • 이 방법은 자원이 풍부한 언어뿐 아니라 자원이 적은 언어, 예를 들어 노르드 사미어와 같은 멸종 위험 언어에서도 뛰어난 성능을 보여, 다국어 및 자원이 적은 NLP 환경에서의 유용성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.