Skip to main content
QUICK REVIEW

[論文レビュー] (Self-Attentive) Autoencoder-based Universal Language Representation for Machine Translation

Carlos Escolano, Marta R. Costa‐jussà|arXiv (Cornell University)|Oct 15, 2018
Natural Language Processing Techniques参考文献 27被引用数 7
ひとこと要約

本稿では、共通の普遍的言語表現を用いて、複数のエンコーダーとデコーダーを同時に学習する自己注意型オートエンコーダーに基づくアーキテクチャを提案する。交差言語的潜在表現間の相関に基づくインターリングアス損失を導入することで、WMT 2017 Turkish-English 翻訳タスクで最先端の BLEU スコアを達成するとともに、普遍的中間表現への進展を示している。

ABSTRACT

Universal language representation is the holy grail in machine translation (MT). Thanks to the new neural MT approach, it seems that there are good perspectives towards this goal. In this paper, we propose a new architecture based on combining variational autoencoders with encoder-decoders and introducing an interlingual loss as an additional training objective. By adding and forcing this interlingual loss, we are able to train multiple encoders and decoders for each language, sharing a common universal representation. Since the final objective of this universal representation is producing close results for similar input sentences (in any language), we propose to evaluate it by encoding the same sentence in two different languages, decoding both latent representations into the same language and comparing both outputs. Preliminary results on the WMT 2017 Turkish/English task shows that the proposed architecture is capable of learning a universal language representation and simultaneously training both translation directions with state-of-the-art results.

研究の動機と目的

  • 複数の言語にまたがる共通の普遍的言語表現を学習するニューラル機械翻訳アーキテクチャの開発。
  • 新しいインターリングアス損失関数を用いて共通の中間表現を明示的に学習することで、多言語翻訳の性能を向上。
  • 交差言語的デコードとオートエンコーディングのパフォーマンスを用いて、普遍的表現の質を評価。
  • 1言語あたり1組のエンコーダ-デコーダを共有表現と組み合わせて使用することで、完全なペairwise 系統の必要性を低減する可能性の調査。
  • 自己注意機構と変分的または非変分的オートエンコーダーを組み合わせることで、普遍的表現を効果的に学習できるかの調査。

提案手法

  • 自己注意メカニズムを用いたトランスフォーマーに基づくエンコーダ-デコーダアーキテクチャに、変分的および非変分的オートエンコーダーを統合。
  • 同じ文の異なる言語における潜在表現間の相関を最大化するインターリングアス損失を導入。
  • 共通の潜在空間を普遍的言語表現として用い、翻訳とインターリングアス整合の目的関数を共同最適化することで学習。
  • 潜在空間における言語のクラスタリングと分離性を評価するため、UMAPを用いて文の表現を可視化。
  • 同じ文を2つの言語から共有デコーダでデコードする比較により、普遍的表現の評価を実施。
  • 表現の容量と分離性を調査するため、標準的および分解型ベクトル量子化(DVQ)を適用。

実験結果

リサーチクエスチョン

  • RQ1インターリングアス損失を用いることで、多言語 NMT システムにおいて共通の普遍的言語表現を効果的に学習できるか?
  • RQ2変分的オートエンコーダーと非変分的オートエンコーダーの選択が、普遍的表現の質および翻訳パフォーマンスに与える影響はいかほどか?
  • RQ3相関に基づくインターリングアス損失は、最大距離損失と比較して、ゼロショットまたは多言語翻訳においてどの程度性能を向上させるか?
  • RQ4普遍的表現は、オートエンコーディングと交差言語的翻訳の両方のタスクをどの程度効果的にサポートできるか?
  • RQ5学習された普遍的表現は、限られた平行データを用いた効果的な転移学習を可能にするか?

主な発見

  • 提案アーキテクチャは、WMT 2017 Turkish-English 翻訳タスクで、EN-TR 8.11、TR-EN 12.00 の最先端 BLEU スコアを達成した。
  • 非変分的オートエンコーダーは、両翻訳方向で変分的オートエンコーダーを1 BLEU 点以上上回った。
  • 相関に基づくインターリングアス損失は、最大距離損失よりも顕著に優れた結果(約1.5 BLEU 高い)を示した。
  • 最も優れたモデル(univ+corr)では、同じ言語のエンコーダからのオートエンコーディング出力(BLEU 63.32 および 59.33)が、翻訳出力(BLEU 12.00 および 8.11)よりもはるかに正確であることが示され、普遍的表現の質の向上の余地があることが示唆された。
  • A-T BLEU スコア(11.90 および 6.02)は、システムが依然として言語間の表現を完全に一致させていないことを示しており、普遍的表現が完全に分離的または不変的でない可能性を示唆している。
  • UMAP 視覚化では、トルコ語と英語の表現が明確にクラスタを形成しており、並列文が潜在空間で一貫して近接していないことが判明し、交差言語的整合性が不完全であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。