Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Source Cross-Lingual Model Transfer: Learning What to Share

Xilun Chen, Ahmed Hassan Awadallah|arXiv (Cornell University)|Oct 8, 2018
Topic Modeling参考文献 48被引用数 7
ひとこと要約

本稿では、敵対的訓練を用いて言語に依存しない特徴を共同で学び、混合エキスパート(MoE)機構を用いて言語固有の特徴を学ぶことで、複数のソース言語からの知識を動的に選択的に共有できる、マルチソースクロスリンガル転移モデルMAN-MoEを提案する。このモデルは、並列コーパスやクロスリンガルの教師信号を必要とせず、無教師多言語埋め込みを組み合わせることで、ゼロリソース設定において最先端の性能を達成する。

ABSTRACT

Modern NLP applications have enjoyed a great boost utilizing neural networks models. Such deep neural models, however, are not applicable to most human languages due to the lack of annotated training data for various NLP tasks. Cross-lingual transfer learning (CLTL) is a viable method for building NLP models for a low-resource target language by leveraging labeled data from other (source) languages. In this work, we focus on the multilingual transfer setting where training data in multiple source languages is leveraged to further boost target language performance. Unlike most existing methods that rely only on language-invariant features for CLTL, our approach coherently utilizes both language-invariant and language-specific features at instance level. Our model leverages adversarial networks to learn language-invariant features, and mixture-of-experts models to dynamically exploit the similarity between the target language and each individual source language. This enables our model to learn effectively what to share between various languages in the multilingual setup. Moreover, when coupled with unsupervised multilingual embeddings, our model can operate in a zero-resource setting where neither target language training data nor cross-lingual resources are available. Our model achieves significant performance gains over prior art, as shown in an extensive set of experiments over multiple text classification and sequence tagging tasks including a large-scale industry dataset.

研究の動機と目的

  • 既存のクロスリンガル転移手法が言語に依存しない特徴にのみ依存し、言語固有の類似性を無視するという限界を解消すること。
  • トークンレベルでのターゲット言語の類似度に基づき、関連するソース言語を動的に選択することで、多言語転移学習の性能を向上させること。
  • 並列コーパスや機械翻訳システムを必要とせず、効果的なゼロリソース転移学習を可能にすること。
  • 多様なNLPタスクおよび低リソース言語ペアにおいて、既存の無教師および教師ありクロスリンガル転移手法を上回ること。

提案手法

  • 複数のソース言語およびターゲット言語にわたる言語に依存しない特徴を学ぶために、敵対的訓練を活用する。
  • 確率的ゲート機構を備えた混合エキスパート(MoE)モジュールを採用し、個々のソース言語からの言語固有特徴を動的に選択・利用する。
  • 無教師多言語単語埋め込み(例:Chen & Cardie, 2018b)を統合することで、並列データが存在しない状況でもゼロリソース学習を可能にする。
  • 入力表現のための共有エンコーダに続き、特徴の不変性を強制するための敵対的ドメイン識別器を用いる。
  • 各トークンごとに、各ソース言語エキスパートの寄与度を決定するソフトアテンションスタイルのゲーティング機構を適用する。
  • ターゲット言語のアノテーションを一切使用せず、ソース言語ラベルの交差エントロピー損失を用いて、エンドツーエンドでモデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1マルチソースクロスリンガル転移モデルは、複数のソース言語にわたる共有内容を効果的に学びつつ、言語固有のパターンを保持できるか?
  • RQ2混合エキスパートモジュールの統合は、多言語転移において、共有特徴にのみ依存するモデルと比較して、性能をどのように向上させるか?
  • RQ3並列コーパスや機械翻訳システムへのアクセスが制限される状況でも、モデルはどの程度高い性能を達成できるか?
  • RQ4本モデルは、多様なNLPタスクおよび言語ペアにおいて、無教師および教師ありクロスリンガル転移ベースラインを上回る性能を発揮するか?

主な発見

  • MAN-MoEは、テキスト分類およびシーケンスタギングタスクにおいて、すべての無教師クロスリンガル転移ベースラインを顕著に上回り、大規模な産業データセット上でも同様の結果を示した。
  • ドイツ語およびフランス語において、MAN-MoEは、ピボットベースの並列コーパスを必要とするUMMと同等の性能を達成したが、完全にゼロリソース設定下で動作している。
  • 日本語においても、無教師単語埋め込みの制限を受けても、強力なクロスリンガルの教師信号を備えた最先端モデルと数ポイント以内で競合する高い性能を発揮した。
  • アマゾンレビューデータセットにおいて、MAN-MoEはCL-SCL、CR-RL、Bi-PV、UMMといった手法を上回る最先端の結果を達成したが、並列データは一切使用していない。
  • エキスパートゲート重みの可視化により、モデルがターゲット言語に言語的に近いソース言語(例:ドイツ語に対して英語)を優先して選択していることが確認された。
  • 無教師多言語埋め込みと組み合わせた場合、MAN-MoEは商業的機械翻訳システムを用いたモデルと同等またはそれ以上の性能を発揮し、特に中国語と日本語のような遠隔言語ペアにおいて顕著な優位性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。