Skip to main content
QUICK REVIEW

[論文レビュー] PidginUNMT: Unsupervised Neural Machine Translation from West African Pidgin to English

Kelechi Ogueji, Orevaoghene Ahia|arXiv (Cornell University)|Dec 7, 2019
Natural Language Processing Techniques被引用数 9
ひとこと要約

本稿では、新たに整備された56,695文のピジン英語コーパス、クロスリンガル単語埋め込み、敵対的訓練およびバックトランスレーションを用いた共有エンコーダ/デコーダアーキテクチャを活用して、西アフリカピジン英語から英語への最初の教師なしニューラル機械翻訳(UNMT)システムを提示する。モデルはピジン→英語でBLEUスコア7.93、英語→ピジンで5.18を達成し、この低リソース言語におけるNLP分野の最初のブレークスルーを示している。

ABSTRACT

Over 800 languages are spoken across West Africa. Despite the obvious diversity among people who speak these languages, one language significantly unifies them all - West African Pidgin English. There are at least 80 million speakers of West African Pidgin English. However, there is no known natural language processing (NLP) work on this language. In this work, we perform the first NLP work on the most popular variant of the language, providing three major contributions. First, the provision of a Pidgin corpus of over 56000 sentences, which is the largest we know of. Secondly, the training of the first ever cross-lingual embedding between Pidgin and English. This aligned embedding will be helpful in the performance of various downstream tasks between English and Pidgin. Thirdly, the training of an Unsupervised Neural Machine Translation model between Pidgin and English which achieves BLEU scores of 7.93 from Pidgin to English, and 5.18 from English to Pidgin. In all, this work greatly reduces the barrier of entry for future NLP works on West African Pidgin English.

研究の動機と目的

  • 西アフリカピジン英語のNLPリソース不足に取り組む。これは約8000万人の話者を有するが、リソースが不足している言語である。
  • 将来的な低リソースアフリカ言語におけるNLP研究を可能にするために、公開可能な最大のピジン-英語並列コーパスを構築する。
  • 下流のマルチリンガルNLPタスクを支援するため、ピジン語と英語の間で最初のクロスリンガル単語埋め込みを学習する。
  • 並列単語対のない単語対応データを用いたピジン語-英語翻訳のための教師なしニューラル機械翻訳モデルを開発・評価する。
  • データ、コード、および訓練済みモデルを公開することで、アフリカ言語におけるNLP研究の入り口を低く抑える。

提案手法

  • ニュースサイトから56,695文の単語対応ピジン語コーパスを収集し、NLPタスクに適した高品質なデータに洗練させる。
  • ピジン語コーパス上でGloVe初期化のCBOWを用いて、グローバルおよびローカルな文脈を捉える最初のピジン語埋め込みを学習する。
  • 教師なし単語対応マッピングによりクロスリンガル単語埋め込みを学習し、翻訳検索精度が0.1282(ランダムベースライン0.009)を達成した。
  • 敵対的訓練、ノイズ除去オートエンコーダ、およびリアルタイムバックトランスレーションを組み合わせた共有エンコーダ/デコーダアーキテクチャを用いて教師なしNMTモデルを実装した。
  • V100 GPU上で学習率0.0003、バッチサイズ16、8エポックでAdam最適化手法を用いてモデルを訓練し、言語識別性の分離を目的とした識別器損失を適用した。
  • JW300データセットの2,101文ペアからなるホールドアウトテストセットにおけるBLEUスコアに基づき、最良のモデルを選定した。

実験結果

リサーチクエスチョン

  • RQ1大規模かつ高品質なピジン語単語対応コーパスをNLPタスクに適した形で収集・整備することは可能か?
  • RQ2並列データが存在しない状況下で、教師なしクロスリンガル単語埋め込みは、ピジン語と英語の語彙表現をどの程度正確に一致させられるか?
  • RQ3単語対応データが完全に存在しない状況下で、教師なしニューラル機械翻訳モデルがピジン語と英語の間で翻訳する際の有効性はいかほどか?
  • RQ4並列データが全くない状況下で、ピジン→英語および英語→ピジンの両方向翻訳において、どの程度のBLEUスコアが達成可能か?
  • RQ5提案されたシステムは、西アフリカピジン英語のような低リソースアフリカ言語における将来的なNLP研究の有効なベースラインとして機能できるか?

主な発見

  • 本研究では、56,695文および32,925語の固有語を含む、公開可能な最初のピジン語-英語コーパスを提供し、言語のリソース可用性を著しく拡大した。
  • 教師なしクロスリンガル埋め込み手法は、翻訳検索精度が0.1282に達し、ランダムベースラインの0.0093を著しく上回った。
  • 教師なしNMTモデルは、ホールドアウトテストセットにおいてピジン語→英語方向でBLEUスコア7.93、英語→ピジン方向で5.18を達成した。
  • 翻訳例の定性的な分析から、モデルは意味的意味と文法的構造を捉えているが、代名詞の使用や語順にやや誤りが見られる場合がある。
  • モデルの性能は、最小限の並列データで教師なしNMTを低リソース言語に適用可能であることを示しており、特に単語対応事前学習とバックトランスレーションを組み合わせた場合に顕著である。
  • 研究者らは、GitHub上でデータセット、コード、および訓練済みモデルを公開し、将来的な再現性とアフリカ言語NLP分野におけるベンチマークの整備を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。