Skip to main content
QUICK REVIEW

[論文レビュー] Data Augmentation and Terminology Integration for Domain-Specific Sinhala-English-Tamil Statistical Machine Translation

Aloka Fernando, Surangika Ranathunga|arXiv (Cornell University)|Nov 5, 2020
Natural Language Processing Techniques参考文献 23被引用数 13
ひとこと要約

本論文は、ドメイン特化型シンハラ語-英語-タミル語統計的機械翻訳におけるデータ拡張技術を提案し、語幹に格助詞(case-marker)を適用して屈曲形を生成することで、語彙が豊富でない言語における未知語(OOV)問題に対処する。この手法は並列単語対訳語彙データを必要とせず、屈曲形のカバー率を向上させることでBLEUスコアを向上させ、低リソース環境下でも有効であることを示している。

ABSTRACT

Out of vocabulary (OOV) is a problem in the context of Machine Translation (MT) in low-resourced languages. When source and/or target languages are morphologically rich, it becomes even worse. Bilingual list integration is an approach to address the OOV problem. This allows more words to be translated than are in the training data. However, since bilingual lists contain words in the base form, it will not translate inflected forms for morphologically rich languages such as Sinhala and Tamil. This paper focuses on data augmentation techniques where bilingual lexicon terms are expanded based on case-markers with the objective of generating new words, to be used in Statistical machine Translation (SMT). This data augmentation technique for dictionary terms shows improved BLEU scores for Sinhala-English SMT.

研究の動機と目的

  • 統計的機械翻訳における、シンハラ語やタミル語のような語彙が豊富でない、構文的に複雑な言語における未知語(OOV)問題に対処すること。
  • 語幹からの屈曲形の生成によって、語幹形にとどまらず、語彙のカバー範囲を拡大すること。
  • 大規模な並列単語対訳語彙データを必要とせず、ドメイン特化型SMTの性能をシンハラ語-英語-タミル語翻訳で向上させること。
  • データ拡張が低リソース翻訳シナリオにおけるBLEUスコアに与える影響を評価すること。
  • 語彙リストから得られる用語を、語彙的正確性を保ちながらSMTシステムに統合する方法を確立すること。

提案手法

  • 本手法は、語幹に格助詞(例:主格、属格、与格など)を適用することで、シンハラ語やタミル語のような語彙が豊富な言語における屈曲形を生成する。
  • 既知のシンハラ語・タミル語の語彙的パターンに基づく言語学的規則を用いて、屈曲形を合成し、学習データの語彙カバー範囲を拡大する。
  • 拡張された語彙リストを翻訳辞書としてSMTシステムに統合し、語の対応付けと翻訳確率推定を改善する。
  • 本手法はドメイン特化型テキストに特化して適用され、ターゲットドメインの用語と整合性を保つ。
  • BLEUスコアを用いて、拡張前後における翻訳品質を評価し、語幹形語彙のみを用いたベースラインSMTと比較する。
  • 本手法は原則として言語に依存しないが、シンハラ語とタミル語の高い語彙的複雑性のため、これらに適用されている。

実験結果

リサーチクエスチョン

  • RQ1格助詞に基づく語彙リストの拡張は、語彙が豊富でない言語における未知語(OOV)の対処に有効であるか?
  • RQ2語幹語彙から生成された屈曲形を用いたデータ拡張は、ドメイン特化型シンハラ語-英語-タミル語SMTにおけるBLEUスコアにどの程度向上効果をもたらすか?
  • RQ3追加の並列単語対訳語彙データを必要とせず、拡張された用語をSMTシステムに統合することはどの程度効果的か?
  • RQ4本手法は、語彙が豊富でない環境下でも、語彙的正確性を保ちながら語彙カバー範囲を拡大できるか?
  • RQ5本手法は、他の語彙が豊富でない言語ペアにも一般化可能か?

主な発見

  • 提案されたデータ拡張手法により、シンハラ語-英語SMTにおける未知語(OOV)率が顕著に低下し、語幹語彙エントリから屈曲形を生成した。
  • 本手法は、語幹形語彙のみを用いたベースラインSMTと比較して、明確なBLEUスコアの向上をもたらし、翻訳品質の向上を示している。
  • 格助詞に基づく拡張は、シンハラ語とタミル語の語彙的変化を効果的に捉え、屈曲形のカバー範囲を向上させた。
  • 拡張された用語のSMTシステムへの統合により、ドメイン特化型文脈における翻訳の頑健性が向上した。
  • 追加の並列単語対訳語彙データを必要とせず、低リソース環境に適した性能向上を達成した。
  • 結果から、格助詞による語彙的拡張が、語彙が豊富でない言語におけるSMT向上の実用的で効果的な戦略であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。