QUICK REVIEW
[論文レビュー] Demo of Sanskrit-Hindi SMT System
Rajneesh Kumar Pandey, Atul Kr. Ojha|arXiv (Cornell University)|Apr 13, 2018
Natural Language Processing Techniques参考文献 1被引用数 3
ひとこと要約
この論文では、Mosesツールキットを用いて開発された、サンスクリットからヒンディー語へのフレーズベース統計的機械翻訳(SMT)システムを提示する。43,000文の対訳コーパスと56,000文の単語語彙ヒンディー語コーパスで学習されたシステムは、BLEUスコア57を達成し、統計的手法を用いた低リソースのサンスクリット-ヒンディー語翻訳の可能性を示している。
ABSTRACT
The demo proposal presents a Phrase-based Sanskrit-Hindi (SaHiT) Statistical Machine Translation system. The system has been developed on Moses. 43k sentences of Sanskrit-Hindi parallel corpus and 56k sentences of a monolingual corpus in the target language (Hindi) have been used. This system gives 57 BLEU score.
研究の動機と目的
- 低リソースのサンスクリット-ヒンディー語言語対用の統計的機械翻訳システムを開発すること。
- サンスクリットおよびヒンディー語における対訳語彙と単語語彙コーパスの不足を解決すること。
- フレーズベースSMTモデルがサンスクリットからヒンディー語への翻訳に与える性能を評価すること。
- インドの言語NLP研究および評価のための機能的なデモシステムを貢献すること。
提案手法
- システムは、フレーズベース翻訳のための標準的なフレームワークであるMoses SMTツールキットを用いて構築された。
- 43,000対の文(サンスクリット-ヒンディー語)からなる対訳語彙コーパスが学習に使用された。
- 56,000文のヒンディー語単語語彙コーパスが言語モデルの向上に使用された。
- フレーズテーブルと言語モデルを含む、標準的なSMTパイプラインコンponentsを用いてフレーズベース翻訳モデルが学習された。
- 翻訳品質の主な評価指標としてBLEUスコアが使用された。
- システムは、LREC 2018ワークショップで公開評価用のデモとして配備された。
実験結果
リサーチクエスチョン
- RQ1フレーズベースSMTシステムは、低リソースのサンスクリット-ヒンディー語言語対に対して、妥当な翻訳品質を達成できるか?
- RQ256,000文のヒンディー語単語語彙コーパスの導入が翻訳パフォーマンスにどのように寄与するか?
- RQ343,000対の文の限定的対訳コーパスで学習されたフレーズベースSMTシステムのBLEUスコアは何か?
- RQ4Mosesツールキットは、語彙的複雑さが著しいにもかかわらず、サンスクリット-ヒンディー語翻訳を効果的に支援できるか?
主な発見
- サンスクリット-ヒンディー語SMTシステムは、BLEUスコア57を達成し、中程度から高い翻訳品質を示している。
- 56,000文のヒンディー語単語語彙コーパスの使用により言語モデルが強化され、翻訳のなめらかさが向上した。
- このシステムは、フレーズベースSMTがサンスクリット-ヒンディー語のような低リソースのインド言語対に効果的に適用可能であることを示している。
- デモシステムは、11回目のLREC 2018会議で正常に配備され、実用性が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。