Skip to main content
QUICK REVIEW

[論文レビュー] Assamese-English Bilingual Machine Translation

Kalyanee Kanchan Baruah, Pranjal Das|arXiv (Cornell University)|Jul 8, 2014
Natural Language Processing Techniques参考文献 3被引用数 5
ひとこと要約

この論文は、Mosesツールキットを用いた統計的フレーズベース機械翻訳システムを、アッサミー語-英語の二か国語翻訳に適用し、IRSTLMによる言語モデル構築とGIZAによる語の対応付けを実施している。英語→アッサミー語翻訳では15.8のBLEUスコアを達成した一方、アッサミー語→英語翻訳では12.4にとどまり、OOV語や固有名詞に対応する統計的表記変換モジュールを備えることで、言語の屈曲的特徴が強いインド諸語における課題が浮き彫りになった。

ABSTRACT

Machine translation is the process of translating text from one language to another. In this paper, Statistical Machine Translation is done on Assamese and English language by taking their respective parallel corpus. A statistical phrase based translation toolkit Moses is used here. To develop the language model and to align the words we used two another tools IRSTLM, GIZA respectively. BLEU score is used to check our translation system performance, how good it is. A difference in BLEU scores is obtained while translating sentences from Assamese to English and vice-versa. Since Indian languages are morphologically very rich hence translation is relatively harder from English to Assamese resulting in a low BLEU score. A statistical transliteration system is also introduced with our translation system to deal basically with proper nouns, OOV (out of vocabulary) words which are not present in our corpus.

研究の動機と目的

  • 低リソースなインド諸語、特にアッサミー語と英語向けの二か国語機械翻訳システムの開発を目的とする。
  • アッサミー語の屈曲的特徴が英語からアッサミー語への翻訳を複雑にするという課題に対処すること。
  • 統計的表記変換システムを用いて、語彙外語(OOV)および固有名詞の翻訳品質を向上させること。
  • 平行単語対訳語彙を用いたBLEUスコア評価を通じて、システムの性能を評価すること。
  • 不足しているリソースを持つインド語対向けの実用的でオープンソースの翻訳パイプラインを貢献すること。

提案手法

  • フレーズベース翻訳モデルの学習に、Moses統計的機械翻訳ツールキットを用いた。
  • アッサミー語-英語の平行語彙対における文単位の対応付けに、GIZA++を採用した。
  • 両言語の言語モデルを、IRSTLMツールキットを用いて構築し、スムーズさと一貫性を向上させた。
  • 未知語やOOV語、特に固有名詞をターゲット言語にマッピングする統計的表記変換システムを統合した。
  • 政府および教育機関の資料から収集した平行語彙を用いて、システムの学習と評価を実施した。
  • 翻訳品質の測定には、機械翻訳評価で標準的な指標であるBLEUスコアを用いた。

実験結果

リサーチクエスチョン

  • RQ1フレーズベース統計的機械翻訳システムは、英語とアッサミー語の間での翻訳にどの程度効果的か?
  • RQ2英語→アッサミー語翻訳とアッサミー語→英語翻訳の間で、性能に差が生じる理由は何か?
  • RQ3統計的表記変換システムは、低リソース環境下でのOOV語および固有名詞の処理を向上させられるか?
  • RQ4アッサミー語の文法的複雑さは、翻訳品質にどの程度影響を及えるか?
  • RQ5言語モデル構築および語の対応付けツールが、この設定下での最終BLEUスコアにどの程度寄与しているか?

主な発見

  • 英語→アッサミー語翻訳方向では15.8のBLEUスコアを達成したのに対し、アッサミー語→英語翻訳では12.4にとどまり、翻訳方向による性能差が確認された。
  • アッサミー語→英語翻訳の低いBLEUスコアは、アッサミー語の文法的豊富さに起因し、翻訳の複雑さが増加しているとされる。
  • 統計的表記変換システムは、学習語彙に含まれないOOV語や固有名詞を効果的に処理できた。
  • GIZA++による語の対応付けとIRSTLMによる言語モデル構築が、システムのスムーズさと正確性に顕著な寄与を果たした。
  • フレーズベースSMTが、測定可能な性能を示すが限定的ではあるが、低リソースなインド語対に適用可能であることが示された。
  • 結果から、文法的複雑さが英語からアッサミー語への翻訳において主要な障壁のままであることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。