Skip to main content
QUICK REVIEW

[論文レビュー] A Masked Segmental Language Model for Unsupervised Natural Language Segmentation

C. M. Downey, Fei Xia|arXiv (Cornell University)|Apr 16, 2021
Natural Language Processing Techniques被引用数 6
ひとこと要約

本稿では、スパンマスキングと双方向注意を用いて教師なし自然言語分割を実行する非再帰的トランスフォーマー基盤アーキテクチャであるマスクドセグメンタル言語モデル(MSLM)を提案する。MSLMは中国語の分割品質において再帰的SLMを大きく上回り、英語でも競争力のある結果を達成しており、特に中国語のような意味的語彙が大きな言語において、トランスフォーマー基盤のモデリングがセグメンタルタスクに有効であることを示している。

ABSTRACT

Segmentation remains an important preprocessing step both in languages where "words" or other important syntactic/semantic units (like morphemes) are not clearly delineated by white space, as well as when dealing with continuous speech data, where there is often no meaningful pause between words. Near-perfect supervised methods have been developed for use in resource-rich languages such as Chinese, but many of the world's languages are both morphologically complex, and have no large dataset of "gold" segmentations into meaningful units. To solve this problem, we propose a new type of Segmental Language Model (Sun and Deng, 2018; Kawakami et al., 2019; Wang et al., 2021) for use in both unsupervised and lightly supervised segmentation tasks. We introduce a Masked Segmental Language Model (MSLM) built on a span-masking transformer architecture, harnessing the power of a bi-directional masked modeling context and attention. In a series of experiments, our model consistently outperforms Recurrent SLMs on Chinese (PKU Corpus) in segmentation quality, and performs similarly to the Recurrent model on English (PTB). We conclude by discussing the different challenges posed in segmenting phonemic-type writing systems.

研究の動機と目的

  • 区切りの明確でない言語、例えば中国語や屈曲的構造が複雑な言語における教師なし分割の課題に対処すること。
  • 双方向的文脈とスパンマスキングを活用した非再帰的、トランスフォーマー基盤のアーキテクチャを構築し、より優れた分割と言語モデリングを実現すること。
  • MSLMを中国語および英語のデータセットに対して評価し、教師なしおよび軽度の教師あり設定における再帰的SLMベースラインと性能を比較すること。
  • トランスフォーマーの音声表記体系における限界を調査し、位置エンコーディングの強化が性能ギャップを埋められるかどうかを評価すること。
  • MSLMを音声分割、多様な表記体系、および深層アーキテクチャスケーリングに拡張する基盤を構築すること。

提案手法

  • MSLMは、文字レベルの入力を対象にスパンマスキングを適用し、ランダムに選ばれた文字スパンをマスキングし、モデルが元のスパンを双方向自己注意を用いて予測する。
  • 学習済み位置埋め込みを用いたトランスフォーマーエンコーダーのアーキテクチャを採用し、文字レベルモデリングにおける位置エンコーディングのロバスト性を向上させるために動的スケーリングを導入している。
  • 自己回帰的デコード中に予測されたセグメントスパンに基づき、高い確率のセグメント境界を特定することで、セグメンテーションを推論する。
  • 損失は予測スパン上で計算され、文字列のマスクド言語モデリング目的で訓練される。
  • ファインチューニング時にゴールドセグメンテーションデータを組み込むことで、教師なしおよび軽度の教師あり学習を両立できる。
  • n-gram語彙制約や期待されるセグメント長の正則化といった正則化技術を評価したが、初期テストではヴァニラMSLMを上回る性能は得られなかった。

実験結果

リサーチクエスチョン

  • RQ1非再帰的でトランスフォーマー基盤のアーキテクチャは、再帰的SLMを教師なし分割タスクで上回ることができるか?
  • RQ2MSLMの双方向的文脈は、一方向の再帰的モデルと比較して、セグメンテーション品質および言語モデリング性能にどのように影響を与えるか?
  • RQ3なぜMSLMは中国語では英語よりも優れているのか? また、表記構造(例:意味的表記対音声表記)はその要因として果たす役割は何か?
  • RQ4MSLMは、複雑な屈曲的構造や音声データに対しても効果的に適用可能か? これは、文字レベルモデリングにおける強力な性能を示唆している。
  • RQ5n-gram語彙や長さ制約といった正則化技術は、MSLMのセグメンテーション品質を向上させるのか、それとも一般化性能を阻害するのか?

主な発見

  • ゴールドバリデーションデータでファインチューニングした場合、MSLMは中国語のセグメンテーション品質において再帰的SLMベースラインを大幅に上回り、教師なし設定でも中程度の優位性を示した。
  • 英語のPenn Treebankでは、MSLMは再帰的SLMと同等のセグメンテーション品質を達成しており、言語モデリング性能に関しては再帰的モデルがわずかに優位であった。
  • 中国語では、MSLMが再帰的SLMよりも優れた言語モデリング性能(低いbpc)を示しており、長距離依存関係をよりよく捉えていることを示している。
  • 英語におけるMSLMと再帰的SLMの性能ギャップは、音声表記体系における静的位置エンコーディングの限界に起因するとされ、単語順序や文字コンテキストに極めて敏感であるためである。
  • 先行研究からの正則化技術(n-gram語彙や長さ制約)をテストしたが、ヴァニラMSLMを上回る性能は得られず、これらの手法が有効であるためにはさらなるハイパーパramータチューニングが必要である可能性を示唆している。
  • 結果から、MSLMは中国語のような意味的語彙が大きな言語に特に適しており、位置エンコーディングの問題が解決されれば、音声表記体系でも再帰的モデルと競合可能な強力な選択肢となる可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。