Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Word Segmentation with Bi-directional Neural Language Model

Lihao Wang, Zongyi Li|arXiv (Cornell University)|Mar 2, 2021
Natural Language Processing Techniques被引用数 8
ひとこと要約

本稿では、すべての可能な分割構造を考慮して文の生成確率を最大化する双方向ニューラル言語モデルを用いた文脈に敏感な教師なし語区切りモデルを提案する。左から右および右から左の文脈特徴を活用することで、語区切りの曖昧性を解消し、中国語のベンチマークで最先端の性能を達成するとともに、タイ語でも競争力のある結果を得た。

ABSTRACT

We present an unsupervised word segmentation model, in which the learning objective is to maximize the generation probability of a sentence given its all possible segmentation. Such generation probability can be factorized into the likelihood of each possible segment given the context in a recursive way. In order to better capture the long- and short-term dependencies, we propose to use bi-directional neural language models to better capture the features of segment's context. Two decoding algorithms are also described to combine the context features from both directions to generate the final segmentation, which helps to reconcile word boundary ambiguities. Experimental results showed that our context-sensitive unsupervised segmentation model achieved state-of-the-art at different evaluation settings on various data sets for Chinese, and the comparable result for Thai.

研究の動機と目的

  • 中国語やタイ語のような言語に共通する語区切りの曖昧性を解消するための単方向モデルの限界を克服すること。
  • 手動でアノテートされたコーパスに依存するのを減らし、生テキストからのみ学習する完全な教師なしアプローチを開発すること。
  • 双方向文脈モデリングにより長期間および短期間の依存関係を組み込むことで、区切り精度を向上させること。
  • 低リソース環境やドメイン外設定を含む多様な分野や言語的特徴に対して、モデルの頑健性を評価すること。
  • 単方向モデルと比較して、双方向文脈特徴が重複するか曖昧な語区切りをより効果的に解消できるかどうかを検証すること。

提案手法

  • モデルは、すべての可能な分割構造に対して文の生成確率を最大化するように設計され、この確率をセグメントごとに再帰的に因数分解する。
  • 各候補セグメントのための豊かな文脈特徴をエンコードするために、左右方向および右から左方向の双方向ニューラル言語モデルが用いられる。
  • 2つのデコーディング戦略を提案する:(1) 前方および後方のセグメント確率を平均化する方法、(2) 別々の前方および後方モデルの出力を統合する方法。
  • 全結合仮説の下で文の生成尤度を最適化するために、バックプロパゲーションを用いてエンドツーエンドで訓練される。
  • 双方向アーキテクチャにより、未来の文脈を活用して左側の境界決定を精緻化でき、重複するか曖昧なセグメントの区切りを改善できる。
  • 外部特徴やルールベースのヒューリスティクスは一切使用せず、生テキストと学習された文脈表現のみを用いる。
Figure 1: The neural network architecture. In this figure, we want to obtain the probability of possible segment “从小”. Firstly, pick out preceding context representation “我” and preceding context representation “学唱歌” from two context LSTMs. Then we used these representations as the initial hidden st
Figure 1: The neural network architecture. In this figure, we want to obtain the probability of possible segment “从小”. Firstly, pick out preceding context representation “我” and preceding context representation “学唱歌” from two context LSTMs. Then we used these representations as the initial hidden st

実験結果

リサーチクエスチョン

  • RQ1双方向ニューラル言語モデルは、両方向からのより豊かな文脈を捉えることで、教師なし語区切りの性能向上に寄与するか?
  • RQ2平均化戦略と統合戦略の異なるデコーディング戦略は、語区切りの曖昧性解消にどのように影響するか?
  • RQ3文脈に敏感な教師なしモデルは、SWAN や SLM のような単方向モデルと比較して、中国語語区切りベンチマークでどの程度優れた性能を示すか?
  • RQ4明示的な語区切り記号が存在しない長めの平均語長を持つ言語(例:タイ語)に対しても、提案手法は一般化可能か?
  • RQ5従来のアプローチでよく誤って区切られる助動詞や機能語を、モデルは効果的に内容語から分離できるか?

主な発見

  • 本モデルは、MSRA、ASIJ、PKU データセットを含む複数の中国語語区切りベンチマークで、さまざまな評価設定において最先端の性能を達成した。
  • 統合デコーディング戦略(前方および後方モデル出力の統合)は平均化戦略よりも高い全体の F1 スコアを達成したが、後者は曖昧なケースでの区切り解消に優れていた。
  • 特に重複語区切りやドメインシフトの処理において、従来の教師なしモデル(SWAN や SLM)を顕著に上回った。
  • タイ語では、平均語長が長く、文字種が少ないという課題にもかかわらず、最近の強力な競合モデルと同等の結果を得た。
  • 双方向文脈により、機能語の区切りが改善され、周囲の内容語に誤って結合されるという一般的な誤差が減少した。
  • モデルの性能は人間アノテーションの一貫性の推定上限(F1 ≈ 0.848)に近く、人間の区切りパターンと強い整合性を示した。
Figure 2: Segmentation error analysis. (a) The errors of different models caused by the combination ambiguity on MSR and PKU datasets. (b) The errors of different models caused by the overlap ambiguity.
Figure 2: Segmentation error analysis. (a) The errors of different models caused by the combination ambiguity on MSR and PKU datasets. (b) The errors of different models caused by the overlap ambiguity.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。