Skip to main content
QUICK REVIEW

[論文レビュー] Extracting an English-Persian Parallel Corpus from Comparable Corpora

Akbar Karimi, Ebrahim Ansari|arXiv (Cornell University)|Nov 2, 2017
Natural Language Processing Techniques参考文献 18被引用数 14
ひとこと要約

本稿では、二方向の機械翻訳と情報検索(IR)システムを活用して、類似したWikipediaドキュメントから高品質な英語-ペルシャ語並列コーパスを抽出する二方向手法を提案する。このアプローチにより、SMTの性能が向上し、類似度スコア順に整列された200,000文の並列コーパスが自由に利用可能になる。

ABSTRACT

Parallel data are an important part of a reliable Statistical Machine Translation (SMT) system. The more of these data are available, the better the quality of the SMT system. However, for some language pairs such as Persian-English, parallel sources of this kind are scarce. In this paper, a bidirectional method is proposed to extract parallel sentences from English and Persian document aligned Wikipedia. Two machine translation systems are employed to translate from Persian to English and the reverse after which an IR system is used to measure the similarity of the translated sentences. Adding the extracted sentences to the training data of the existing SMT systems is shown to improve the quality of the translation. Furthermore, the proposed method slightly outperforms the one-directional approach. The extracted corpus consists of about 200,000 sentences which have been sorted by their degree of similarity calculated by the IR system and is freely available for public access on the Web.

研究の動機と目的

  • 統計的機械翻訳(SMT)のための英語-ペルシャ語並列学習データの不足に取り組む。
  • 対応するWikipediaエディションのような類似コーパスから並列文をマイニングするスケーラブルな手法を開発する。
  • 自動抽出された並列文で既存の学習データを拡張することで、SMTの翻訳品質を向上させる。
  • 類似度スコアに基づいて、二方向と単方向の抽出戦略の間で、アライメント品質および下流の翻訳性能を評価・比較する。

提案手法

  • ドキュメントレベルのアライメントを用いて、英語とペルシャ語のWikipedia記事を対応付けて、類似コーパスを構築する。
  • ペルシャ語から英語への翻訳と、英語からペルシャ語への翻訳の2つの独立した機械翻訳システムを適用し、各言語のテキストを相手言語に翻訳する。
  • 情報検索(IR)システムを用いて、翻訳された文と元の単言語文との間の文レベルの類似度を計算する。
  • 類似度スコアに基づいて抽出された文ペアをランク付けし、高品質な並列文をフィルタリング・優先順位付けする。
  • 類似度スコアが非常に高い文ペアのみを選別して、最終的な並列コーパスを構築する。
  • 得られた200,000文の並列コーパスを研究利用のために公開する。

実験結果

リサーチクエスチョン

  • RQ1二方向の機械翻訳とIRベースのマッチングは、類似した英語-ペルシャ語Wikipediaコーパスから高品質な並列文を効果的に抽出できるか?
  • RQ2類似度スコアに基づく二方向抽出手法は、単方向アプローチと比較して、アライメント品質およびSMT向上の観点でどの程度優れているか?
  • RQ3抽出された並列コーパスは、既存のSMTシステムの翻訳品質をどの程度向上させるか?
  • RQ4類似度スコアの導入が、抽出された並列データの信頼性および有用性に与える影響は何か?

主な発見

  • 提案された二方向手法は、高品質な並列文ペアを抽出する点で、単方向手法をわずかに上回る。
  • 抽出されたコーパスには約200,000の文ペアが含まれており、利用性を高めるために類似度スコア順に整列されている。
  • 既存のSMT学習データに抽出された文を追加することで翻訳品質が向上し、コーパスの実用性が裏付けられた。
  • コーパスは研究利用のために公開されており、ペルシャ語-英語のような低リソース言語対の今後の研究を支援する。
  • IRベースの類似度測定は、事前に並列テキストが存在しない状況下でも、有効な並列文ペアを効果的に同定できた。
  • ペルシャ語-英語の並列データが乏しい状況下でも、本手法は有効であることが示され、低リソースMTシナリオにおける実用的解決策を提供した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。