[論文レビュー] Statistical Machine Translation for Indian Languages: Mission Hindi
本稿では、アグリューティブ・インディアン言語(ベンガル語、マラガリ語、タミル語、テルグ語)からヒンディー語への統計的機械翻訳(SMT)の前処理手法として、接尾語分離(SS)と複合語分割(CS)を提案し、ベースラインシステムと比較してBLEUスコアを顕著に向上させた。英語-ヒンディー語翻訳では、送信側の語順再配置と要因付きSMTを併用することで性能が向上し、最良のシステムではテストセットで22.83のBLEUを達成した。
This paper discusses Centre for Development of Advanced Computing Mumbai's (CDACM) submission to the NLP Tools Contest on Statistical Machine Translation in Indian Languages (ILSMT) 2014 (collocated with ICON 2014). The objective of the contest was to explore the effectiveness of Statistical Machine Translation (SMT) for Indian language to Indian language and English-Hindi machine translation. In this paper, we have proposed that suffix separation and word splitting for SMT from agglutinative languages to Hindi significantly improves over the baseline (BL). We have also shown that the factored model with reordering outperforms the phrase-based SMT for English-Hindi (\enhi). We report our work on all five pairs of languages, namely Bengali-Hindi (\bnhi), Marathi-Hindi (\mrhi), Tamil-Hindi ( ahi), Telugu-Hindi ( ehi), and \enhi for Health, Tourism, and General domains.
研究の動機と目的
- アグリューティブ・インディアン言語の送信言語とヒンディー語との間の語彙的乖離を統計的機械翻訳で是正すること。
- 接尾語分離や複合語分割といった前処理手法により未知語を削減することで翻訳品質を向上させること。
- ベンガル語-ヒンディー語、マラガリ語-ヒンディー語、タミル語-ヒンディー語、テルグ語-ヒンディー語、英語-ヒンディー語の複数の言語対に対して、これらの手法の有効性を評価すること。
- 特に英語-ヒンディー語翻訳において、語順と対訳の構造的乖離を調査すること。
- ILSMT 2014の共同タスクに最適化されたシステムを提出し、医療、観光、一般分野の各分野における性能を分析すること。
提案手法
- 接尾語分離(SS)は、手動で作成された接尾語リストを用いて、ヒンディー語の後置詞に対応する既知の接尾語を識別し、送信言語の語から分離することで適用される。
- 複合語分割(CS)は、単語の頻出接尾語を単語コーパスから特定することで、再帰的に複雑な語を語彙的に妥当な成分に分解する。
- 英語-ヒンディー語翻訳では、英語の文法構造をヒンディー語のSOV語順に合わせるために送信側の語順再配置が適用され、対訳とデコードの質が向上する。
- ベースラインとしてフレーズベースSMTシステムを用い、語幹対訳を対訳要因として用いた要因付きモデルによる追加改善を実施する。
- システムは共同タスクのデータと単語コーパスを用いて学習され、開発セットおよびテストセットでBLEU、NIST、TERの指標を用いて評価される。
- 過剰な固有名の分割や誤った分割によるデータスパarsityの増加といった問題を特定するため、誤差分析が実施された。
実験結果
リサーチクエスチョン
- RQ1アグリューティブ・インディアン言語からヒンディー語へのSMTにおいて、接尾語分離はベースラインと比較して顕著に性能を向上させるか?
- RQ2マラガリ語やテルグ語のような語彙的に複雑な送信言語において、複合語分割は翻訳品質をどの程度向上させるか?
- RQ3英語-ヒンディー語SMTにおいて、送信側の語順再配置は対訳と翻訳品質の向上にどの程度効果的か?
- RQ4なぜ接尾語分離と複合語分割を併用するとベンガル語およびマラガリ語で性能が低下するのか、その原因は何か?
- RQ5語幹対訳を用いた要因付きSMTは、語順再配置ベースのシステムを上回る性能を示すのか?
主な発見
- ベンガル語-ヒンディー語翻訳において、接尾語分離のみでBLEUが30.16から31.73に上昇し、ベースライン比で1.57ポイントの向上を示した。
- マラガリ語-ヒンディー語翻訳では、接尾語分離によりBLEUが35.56から39.84に上昇し、4.28ポイントの改善が得られ、高い有効性が示された。
- テルグ語-ヒンディー語翻訳では、複合語分割によりBLEUが16.76から20.16に上昇し、3.4ポイントの向上を示し、極めてアグリューティブな言語において有効であることが確認された。
- 英語-ヒンディー語翻訳では、送信側の語順再配置によりBLEUが18.52から22.72に上昇し、4.2ポイントの改善が得られ、顕著な効果が示された。
- 語順再配置を組み合わせた要因付きSMTシステムは22.83のBLEUを達成し、語順再配置のみのシステム(22.72)をわずかに上回ったが、他の指標では語順再配置システムが優れていた。
- 英語-ヒンディー語翻訳の最終提出システムはBL+RO+FACTを採用し、テストセットで22.83のBLEUを達成し、評価されたすべてのシステムの中で最高のスコアを記録した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。