Skip to main content
QUICK REVIEW

[論文レビュー] Implementation of Rule Based Algorithm for Sandhi-Vicheda Of Compound Hindi Words

Priyanka Gupta, Vishal Goyal|ArXiv.org|Sep 12, 2009
Algorithms and Data Compression参考文献 11被引用数 6
ひとこと要約

この論文では、音声的規則を活用して砂置(sandhi)で結合された複合ヒンディー語語彙をその構成語に分解するルールベースのアルゴリズムを提示している。このアプローチは、ルールカバレッジに応じて60–80%の正確性を達成しており、ヒンディー語言語処理および教育的応用における体系的で計算効率の良い手法を提供する。

ABSTRACT

Sandhi means to join two or more words to coin new word. Sandhi literally means `putting together' or combining (of sounds), It denotes all combinatory sound-changes effected (spontaneously) for ease of pronunciation. Sandhi-vicheda describes [5] the process by which one letter (whether single or cojoined) is broken to form two words. Part of the broken letter remains as the last letter of the first word and part of the letter forms the first letter of the next letter. Sandhi- Vicheda is an easy and interesting way that can give entirely new dimension that add new way to traditional approach to Hindi Teaching. In this paper using the Rule based algorithm we have reported an accuracy of 60-80% depending upon the number of rules to be implemented.

研究の動機と目的

  • 複合ヒンディー語語彙の砂置接合部における体系的で計算可能な分解手法を開発すること。
  • 統計的またはコーパスベースの手法ではなく、ルールベースのアプローチを用いることで、自動化された砂置分解の正確性を向上させること。
  • 複合語形成の構造的分析を可能にすることで、ヒンディー語教育における応用を支援すること。
  • ルールカバレッジや言語的複雑さの変動に応じた、ルールベースの分解のパフォーマンスを評価すること。
  • インド・アリヤン語族における形態解析ツールのさらなる開発の基盤を提供すること。

提案手法

  • アルゴリズムは、手動で定義された音声的および表記的規則のセットを適用し、複合ヒンディー語語彙内の砂置境界パターンを同定・分解する。
  • 規則は、主にヒンディー語複合語におけるサンスクリット由来の砂置パターンの構造に基づいており、母音および子音の組み合わせに焦点を当てる。
  • システムは入力語彙をスキャンし、既知の砂置パターンを特定し、変換規則を適用して語を2つの構成語に分割する。
  • アルゴリズムはグラーフェムおよび音素のパターンマッチングを用いて有効な砂置接合部を検出するが、特にविसर्ग(visarga)およびस्वरित(svarita)記号に注意を払う。
  • パフォーマンスは、アルゴリズムの出力と手動でアノテートされた分割結果を比較することで評価され、複数のテストケースで正確性が測定される。
  • 実装は拡張可能に設計されており、新たな規則を段階的に追加することでカバレッジと正確性を向上できる。

実験結果

リサーチクエスチョン

  • RQ1ルールベースのアプローチは、複合ヒンディー語語彙における砂置分解を的確に行うのにどの程度効果的か?
  • RQ2ルールカバレッジがアルゴリズム全体の正確性に与える影響は何か?
  • RQ3決定論的ルールベースシステムは、ヒンディー語複合語の形態的複雑性を、受け入れ可能な精度で処理できるか?
  • RQ4このルールベースシステムのパフォーマンスは、同じ分野における統計的または機械学習の代替手法と比べてどうか?
  • RQ5この手法は、自動ヒンディー語学習および言語解析ツールの支援にどの程度寄与できるか?

主な発見

  • ルールベースのアルゴリズムは、実装されたルールの数や複雑さに応じて、砂置分解において60%から80%の正確性を達成している。
  • より包括的かつ文脈に敏感なルールがシステムに組み込まれると、より高い正確性が得られる。
  • この方法は、特にतत्सम(tatsama)およびतद्भव(tadbhava)複合語における一般的な砂置パターンを効果的に処理している。
  • アルゴリズムは、विसर्ग(visarga)およびस्वरित(svarita)記号を含むさまざまな種類の複合語においても一貫したパフォーマンスを示している。
  • 結果から、ヒンディー語のようなリソースが限られた言語環境においても、ルールベースのシステムが形態解析に有効であることが示唆される。
  • 本研究は、大規模なアノテート済みコーパスがなくても、手動によるルール設計が信頼性のある結果をもたらす可能性を確認している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。