Skip to main content
QUICK REVIEW

[論文レビュー] Machine Translation Approaches and Survey for Indian Languages

Nadeem Jadoon Khan, Waqas Anwar|arXiv (Cornell University)|Jan 16, 2017
Natural Language Processing Techniques参考文献 30被引用数 7
ひとこと要約

この論文は、8つのインド諸言語(ベンガル語、グジャラト語、ヒンディー語、マラヤーラム語、パンジャブ語、タミル語、テルグ語、ウルドゥー語)から英語への文脈ベースの統計的機械翻訳(SMT)システムを評価している。限られた並列コーパスがあるにもかかわらず、著者らは平均BLEUスコアが10%に達するベースラインシステムを確立し、低リソースなインド諸言語環境における言語資源の向上とSMTの開発の必要性を浮き彫りにしている。

ABSTRACT

In this study, we present an analysis regarding the performance of the state-of-art Phrase-based Statistical Machine Translation (SMT) on multiple Indian languages. We report baseline systems on several language pairs. The motivation of this study is to promote the development of SMT and linguistic resources for these language pairs, as the current state-of-the-art is quite bleak due to sparse data resources. The success of an SMT system is contingent on the availability of a large parallel corpus. Such data is necessary to reliably estimate translation probabilities. We report the performance of baseline systems translating from Indian languages (Bengali, Guajarati, Hindi, Malayalam, Punjabi, Tamil, Telugu and Urdu) into English with average 10% accurate results for all the language pairs.

研究の動機と目的

  • リソースが乏しいインド諸言語ペアにおける最新の文脈ベースSMTのパフォーマンスを評価すること。
  • 並列コーパスが不足しているため、複数のインド諸言語から英語へのベースライン翻訳システムを確立すること。
  • 訓練データが限られたインド諸言語におけるSMTおよび言語資源の開発を促進すること。
  • 低リソースなインド諸言語における機械翻訳の主な課題を特定すること。

提案手法

  • 翻訳デコードにMosesなどの標準ツールを用いた文脈ベースSMTシステムの実装。
  • 各インド諸言語ペアの利用可能な並列単語対訳コーパスと単一言語コーパスの使用。
  • 並列文から推定されたフレーズ翻訳確率に基づく翻訳モデルの学習。
  • ターゲット言語(英語)におけるスムーズさを向上させるために言語モデルの適用。
  • すべての言語ペアにおいて翻訳品質を測定するためにBLEUスコアを用いた評価。
  • 標準SMTパイプライン構成に従い、ベースラインシステムを訓練および評価。

実験結果

リサーチクエスチョン

  • RQ1限られた並列データを有するインド諸言語ペアにおいて、文脈ベースSMTのパフォーマンスはいかほどか?
  • RQ2構文的・語彙的構造の差が著しい多様なインド諸言語において、ベースラインSMTシステムのパフォーマンスはどのようになるか?
  • RQ3低リソースなインド諸言語向けに効果的なSMTシステムを開発するうえでの主なボトルネックは何か?
  • RQ4既存のSMTフレームワークは、インド諸言語の最小限の並列コーパスでも、ある程度の翻訳品質を達成できるか?

主な発見

  • 8つのインド諸言語から英語への翻訳ペア全体の平均BLEUスコアは10%であり、低水準ではあるがベースラインとしてのパフォーマンスを示している。
  • 言語ごとにパフォーマンスに顕著な差が見られ、データの可用性が高く、英語に近い言語的特徴を有する言語ペアではスコアが高かった。
  • 本研究は、並列単語対訳コーパスの不足がインド諸言語におけるSMTパフォーマンスを著しく制限していることを確認している。
  • データが乏しくてもベースラインシステムが正常に実装されたことから、低リソース環境下でもSMTの実現可能性が示された。
  • 研究結果は、より大規模で高品質な並列コーパスおよび言語資源の整備が急務であることを強調している。
  • 本研究は、インド諸言語NLP分野における将来のニューラル機械翻訳およびデータ拡張研究の基盤を提供している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。