Skip to main content
QUICK REVIEW

[論文レビュー] Lexical Resources for Hindi Marathi MT

S Sreelekha, Pushpak Bhattacharyya|arXiv (Cornell University)|Mar 4, 2017
Natural Language Processing Techniques参考文献 12被引用数 4
ひとこと要約

本稿では、インド語・マラガリ語の翻訳ペアにおける統計的機械翻訳(MT)の向上を図るために、インドウッドネット、機能語、kridantaペア、動詞フレーズなどの多様な語彙的リソースを訓練コーパスに統合することを提案する。語彙と語形の両方を拡張することで、特に限られた並列データ下でも翻訳品質とカバレッジが著しく向上し、翻訳方向の両方における事例研究と誤字分析を通じて実証されている。

ABSTRACT

In this paper we describe some ways to utilize various lexical resources to improve the quality of statistical machine translation system. We have augmented the training corpus with various lexical resources such as IndoWordnet semantic relation set, function words, kridanta pairs and verb phrases etc. Our research on the usage of lexical resources mainly focused on two ways such as augmenting parallel corpus with more vocabulary and augmenting with various word forms. We have described case studies, evaluations and detailed error analysis for both Marathi to Hindi and Hindi to Marathi machine translation systems. From the evaluations we observed that, there is an incremental growth in the quality of machine translation as the usage of various lexical resources increases. Moreover usage of various lexical resources helps to improve the coverage and quality of machine translation where limited parallel corpus is available.

研究の動機と目的

  • 低リソースなヒンディ・マラガリ語翻訳ペアにおける統計的機械翻訳の品質向上を目的とする。
  • 並列訓練データが限られている課題に対処するため、語彙的リソースを用いてコーパスを豊かにすることを目的とする。
  • 異なる語彙的リソースが両方向(ヒンディ→マラガリ、マラガリ→ヒンディ)における翻訳パフォーマンスに与える影響を調査することを目的とする。
  • 語彙拡張と語形拡張の有効性を、語彙的リソースを用いて評価することを目的とする。
  • 誤字分析を実施し、語彙的リソースが翻訳誤りに与える影響を理解することを目的とする。

提案手法

  • インドウッドネットの意味関係、機能語、kridantaペア、動詞フレーズを含む語彙的リソースを並列訓練コーパスに統合する。
  • 訓練データの語彙と語形を拡張することで、カバレッジと一般化能力を向上させる。
  • 両方の翻訳タスク(ヒンディ→マラガリ、マラガリ→ヒンディ)に対して、拡張された訓練データを用いた統計的機械翻訳パイプラインを適用する。
  • 標準的なMTメトリクスを用いた事例研究と定量的評価を通じて、改善効果を評価する。
  • 誤字分析を実施し、誤りのパターンを特定するとともに、語彙的リソースが誤りの低減に与える影響を評価する。
  • 語形的および意味的リソースの組み合わせを用いて、低リソース環境下での語彙的豊かさを向上させる。

実験結果

リサーチクエスチョン

  • RQ1語彙的リソースを用いて訓練コーパスを拡張すると、ヒンディ・マラガリ語MTにおける翻訳品質にどのような影響を与えるか?
  • RQ2意味的・機能的・語形的リソースといった、異なる種類の語彙的リソースは、パフォーマンス向上にどの程度寄与するか?
  • RQ3並列訓練データが限られている状況下でも、語彙的リソースの拡張が翻訳品質の向上に寄与するか?
  • RQ4語彙的リソースは、ヒンディ・マラガリ語翻訳システムにおける誤りパターンにどのように影響を与えるか?
  • RQ5複数の語彙的リソースを組み合わせた際の、MTシステムパフォーマンスへの段階的影響は何か?

主な発見

  • 語彙的リソースの統合により、ヒンディ→マラガリおよびマラガリ→ヒンディの両方向で翻訳品質が段階的に向上した。
  • 語形的および意味的語彙的リソースは、特に低リソース環境下で語彙カバレッジを顕著に向上させた。
  • kridantaペアおよび動詞フレーズの使用により、翻訳における文構造的および意味的構造の処理が改善された。
  • 誤字分析の結果、語彙的拡張により語の選択誤りや屈折形の誤りが低減したことが明らかになった。
  • 機能語およびインドウッドネットの意味関係が、翻訳出力の流暢さと一貫性の向上に寄与した。
  • 語彙的リソース統合の各段階でシステム全体のパフォーマンスが向上し、累積的利点が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。