[論文レビュー] FST Based Morphological Analyzer for Hindi Language
本稿では、SFSTツールを用いたFSTベースのヒンディー語の解析器を提示する。語根語彙を構築し、語彙的変化則と派生則を適用することで語形を生成する。スタンフォードMAXENTタガッパーを用いたPOSタギングパイプラインで評価した結果、既知語の語形解析で97%、POSタギングで87%の精度を達成し、未知語では80%の精度を示した。
Hindi being a highly inflectional language, FST (Finite State Transducer) based approach is most efficient for developing a morphological analyzer for this language. The work presented in this paper uses the SFST (Stuttgart Finite State Transducer) tool for generating the FST. A lexicon of root words is created. Rules are then added for generating inflectional and derivational words from these root words. The Morph Analyzer developed was used in a Part Of Speech (POS) Tagger based on Stanford POS Tagger. The system was first trained using a manually tagged corpus and MAXENT (Maximum Entropy) approach of Stanford POS tagger was then used for tagging input sentences. The morphological analyzer gives approximately 97% correct results. POS tagger gives an accuracy of approximately 87% for the sentences that have the words known to the trained model file, and 80% accuracy for the sentences that have the words unknown to the trained model file.
研究の動機と目的
- ヒンディー語のような高い屈曲性を持つ言語に対して、有限状態トランスデューサー(FST)技術を用いて効率的な語彙解析器を開発すること。
- 語彙的変化則および派生則を定義し、語彙の根語を基にした多様な語形を生成する包括的な語彙の構築。
- 語彙解析器をPOSタギングパイプラインに統合し、ヒンディー語テキストのタギング精度を向上させること。
- 手動でタグ付けされたコーパスを用いて、語彙解析器の性能およびPOSタギングに与える影響を評価すること。
提案手法
- 著者は、ヒンディー語用のFSTベースの語彙解析器を実装するために、SFST(シュトゥットガルト有限状態トランスデューサ)ツールを用いた。
- 語彙の基盤として、語根語彙が手動で収集された。
- FST遷移を用いて語根語からさまざまな語形を生成するための屈曲的および派生的規則が定義された。
- スタンフォードPOSタガッパーを用い、MAXENT(最大エントロピー)モデルを用いて、語彙解析器をPOSタギングシステムに統合した。
- 単語とタグの関連を学習するために、手動でタグ付けされたヒンディー語コーパスでシステムを学習させた。
- 入力文はPOSタギングの前に語彙解析器を通過させることで、語形の認識を向上させた。
実験結果
リサーチクエスチョン
- RQ1高い屈曲的複雑性を持つヒンディー語において、FSTベースのアプローチが語彙解析にどの程度有効であるか。
- RQ2語彙解析器を統合することで、ヒンディー語のPOSタギング精度がどの程度向上するか。
- RQ3テストセットにおける既知語と未知語の両方において、語彙解析器の性能はいかほどか。
- RQ4SFSTは、他のFSTツールと比較して、ヒンディー語処理における実装効率および精度の面でどの程度優れているか。
主な発見
- FSTベースの語彙解析器は、ヒンディー語語形の正しく解析される確率が約97%に達した。
- POSタガッパーは、訓練済みモデルに登録された語を含む文に対して87%の精度を達成した。
- モデルに登録されていない語を含む文では、POSタガッパーは80%の精度を示し、未知語に対しても頑健であることが示された。
- 語彙解析器をPOSタギングパイプラインに統合することで、語形認識の向上が図られ、全体の性能が向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。