Skip to main content
QUICK REVIEW

[論文レビュー] Using Multiple Sources of Information for Constraint-Based Morphological Disambiguation

Gökhan Tür|ArXiv.org|Jul 30, 1996
Natural Language Processing Techniques被引用数 3
ひとこと要約

この論文は、トルコ語のようなアグリューティブ言語を対象として、手作業で作成された文法的ルール、学習された制約、およびターゲットテキストからの統計的情報を統合する、制約ベースの形態素解析の不確実性除去システムを提示する。これらの情報源を組み合わせることで、1トークンあたり1.03未満の不確実な解析、96–97%の再現率、93–94%の正確率を達成し、二次的な形態素処理装置により1%未満のトークンが未知のままである。

ABSTRACT

This thesis presents a constraint-based morphological disambiguation approach that is applicable to languages with complex morphology--specifically agglutinative languages with productive inflectional and derivational morphological phenomena. For morphologically complex languages like Turkish, automatic morphological disambiguation involves selecting for each token morphological parse(s), with the right set of inflectional and derivational markers. Our system combines corpus independent hand-crafted constraint rules, constraint rules that are learned via unsupervised learning from a training corpus, and additional statistical information obtained from the corpus to be morphologically disambiguated. The hand-crafted rules are linguistically motivated and tuned to improve precision without sacrificing recall. In certain respects, our approach has been motivated by Brill's recent work, but with the observation that his transformational approach is not directly applicable to languages like Turkish. Our approach also uses a novel approach to unknown word processing by employing a secondary morphological processor which recovers any relevant inflectional and derivational information from a lexical item whose root is unknown. With this approach, well below 1% of the tokens remains as unknown in the texts we have experimented with. Our results indicate that by combining these hand-crafted, statistical and learned information sources, we can attain a recall of 96 to 97% with a corresponding precision of 93 to 94%, and ambiguity of 1.02 to 1.03 parses per token.

研究の動機と目的

  • 語形変化と派生形態素が豊富に存在するアグリューティブ言語(例:トルコ語)における形態素解析の不確実性除去の課題に対処すること。
  • 手作業で作成したルール、学習された制約、コーパス統計情報を統合した、より優れた不確実性除去性能を実現するシステムの開発。
  • 語幹推定による解析を実行する二次的形態素処理装置を用いて、形態素処理における未知語の数を削減すること。
  • 高い再現率と正確率を達成するとともに、形態素解析における不確実性を最小限に抑えること。
  • ブリルの変換的アプローチとは異なり、トルコ語に直接適用できないため、制約ベースの手法の適用範囲を拡張すること。

提案手法

  • 再現率を落とさずに正確率を向上させるために、言語学的根拠に基づいた手作業で作成した制約ルールを用いる。
  • 訓練コーパスから追加の制約ルールを非教師あり学習で抽出することで、カバレッジと適応性を向上させる。
  • ターゲットコーパスからの統計的情報を統合し、不確実性除去の意思決定を支援する。
  • 未知語は、語幹を推定し、派生形態素と屈折形態素を回復することで、二次的形態素処理装置が解析する。
  • 手作業で作成したルール、学習された制約、統計データの3つの情報源を、制約ベースの推論フレームワーク内で統合する。
  • 不確実性除去プロセスでは、すべての情報源からの統合的証拠に基づいて、可能な形態素解析の順位付けを行う。

実験結果

リサーチクエスチョン

  • RQ1アグリューティブ言語(例:トルコ語)において、語形変化と派生形態素が非常に生産的である場合に、制約ベースのシステムが形態素解析の不確実性除去を効果的に行えるか。
  • RQ2手作業で作成したルール、学習された制約、統計的情報を統合することで、単一情報源アプローチと比較して、不確実性除去性能がどのように向上するか。
  • RQ3二次的形態素処理装置が、形態素解析における未知トークンの数をどの程度削減できるか。
  • RQ4提案手法が、高い再現率と正確率を達成するとともに、形態素解析における不確実性を低く保てるか。
  • RQ5変換的アプローチ(例:ブリルの手法)がトルコ語の形態素構造に対して直接適用できない場合でも、制約ベースのアプローチがトルコ語に適用可能か。

主な発見

  • このシステムは、トルコ語の形態素解析の不確実性除去タスクにおいて、96–97%の再現率、93–94%の正確率を達成した。
  • 不確実性率は1.02–1.03解析/トークンにまで低下し、高い不確実性除去の信頼性を示している。
  • 二次的形態素処理装置のおかげで、処理後1%未満のトークンが未知のままである。
  • 手作業で作成したルール、学習された制約、統計的情報の統合により、不確実性除去の正確性が顕著に向上した。
  • 変換的アプローチ(例:ブリルの手法)の制限を克服し、トルコ語の形態素構造に適した手法として成功裏に実装された。
  • 高い形態素的複雑性を示す実世界のトルコ語テキストに対しても、本システムは強固な性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。