Skip to main content
QUICK REVIEW

[論文レビュー] Demo of Sanskrit-Hindi SMT System

Rajneesh Kumar Pandey, Atul Kr. Ojha|arXiv (Cornell University)|Apr 13, 2018
Natural Language Processing Techniques参考文献 1被引用数 3
ひとこと要約

この論文では、Mosesツールキットを用いて開発された、サンスクリットからヒンディー語へのフレーズベース統計的機械翻訳(SMT)システムを提示する。43,000文の対訳コーパスと56,000文の単語語彙ヒンディー語コーパスで学習されたシステムは、BLEUスコア57を達成し、統計的手法を用いた低リソースのサンスクリット-ヒンディー語翻訳の可能性を示している。

ABSTRACT

The demo proposal presents a Phrase-based Sanskrit-Hindi (SaHiT) Statistical Machine Translation system. The system has been developed on Moses. 43k sentences of Sanskrit-Hindi parallel corpus and 56k sentences of a monolingual corpus in the target language (Hindi) have been used. This system gives 57 BLEU score.

研究の動機と目的

  • 低リソースのサンスクリット-ヒンディー語言語対用の統計的機械翻訳システムを開発すること。
  • サンスクリットおよびヒンディー語における対訳語彙と単語語彙コーパスの不足を解決すること。
  • フレーズベースSMTモデルがサンスクリットからヒンディー語への翻訳に与える性能を評価すること。
  • インドの言語NLP研究および評価のための機能的なデモシステムを貢献すること。

提案手法

  • システムは、フレーズベース翻訳のための標準的なフレームワークであるMoses SMTツールキットを用いて構築された。
  • 43,000対の文(サンスクリット-ヒンディー語)からなる対訳語彙コーパスが学習に使用された。
  • 56,000文のヒンディー語単語語彙コーパスが言語モデルの向上に使用された。
  • フレーズテーブルと言語モデルを含む、標準的なSMTパイプラインコンponentsを用いてフレーズベース翻訳モデルが学習された。
  • 翻訳品質の主な評価指標としてBLEUスコアが使用された。
  • システムは、LREC 2018ワークショップで公開評価用のデモとして配備された。

実験結果

リサーチクエスチョン

  • RQ1フレーズベースSMTシステムは、低リソースのサンスクリット-ヒンディー語言語対に対して、妥当な翻訳品質を達成できるか?
  • RQ256,000文のヒンディー語単語語彙コーパスの導入が翻訳パフォーマンスにどのように寄与するか?
  • RQ343,000対の文の限定的対訳コーパスで学習されたフレーズベースSMTシステムのBLEUスコアは何か?
  • RQ4Mosesツールキットは、語彙的複雑さが著しいにもかかわらず、サンスクリット-ヒンディー語翻訳を効果的に支援できるか?

主な発見

  • サンスクリット-ヒンディー語SMTシステムは、BLEUスコア57を達成し、中程度から高い翻訳品質を示している。
  • 56,000文のヒンディー語単語語彙コーパスの使用により言語モデルが強化され、翻訳のなめらかさが向上した。
  • このシステムは、フレーズベースSMTがサンスクリット-ヒンディー語のような低リソースのインド言語対に効果的に適用可能であることを示している。
  • デモシステムは、11回目のLREC 2018会議で正常に配備され、実用性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。