Skip to main content
QUICK REVIEW

[論文レビュー] Transformer based Multilingual document Embedding model

Wei Li, Brian Mak|arXiv (Cornell University)|Aug 19, 2020
Topic Modeling参考文献 22被引用数 4
ひとこと要約

この論文は、LASERのBiLSTMエンコーダを自己注意メカニズムを備えたトランスフォーマー構造に置き換え、クロスリンガルアライメントを向上させるために新しい距離制約損失を導入した、トランスフォーマーに基づく多言語ドキュメント埋め込みモデルcT-LASERを提案する。モデルはより高速な学習を実現し、特にクロスリンガル転移タスクにおいてLASERおよび標準T-LASERを著しく上回り、クロスリンガル分類ベンチマークでLASERより7.2%の性能向上を達成する。

ABSTRACT

One of the current state-of-the-art multilingual document embedding model LASER is based on the bidirectional LSTM neural machine translation model. This paper presents a transformer-based sentence/document embedding model, T-LASER, which makes three significant improvements. Firstly, the BiLSTM layers is replaced by the attention-based transformer layers, which is more capable of learning sequential patterns in longer texts. Secondly, due to the absence of recurrence, T-LASER enables faster parallel computations in the encoder to generate the text embedding. Thirdly, we augment the NMT translation loss function with an additional novel distance constraint loss. This distance constraint loss would further bring the embeddings of parallel sentences close together in the vector space; we call the T-LASER model trained with distance constraint, cT-LASER. Our cT-LASER model significantly outperforms both BiLSTM-based LASER and the simpler transformer-based T-LASER.

研究の動機と目的

  • LASERのBiLSTMエンコーダをトランスフォーマー構造に置き換えることで、より高速かつ効果的な多言語ドキュメント埋め込みモデルの開発を目的とする。
  • 新規の距離制約損失関数を導入することで、多言語埋め込みのクロスリンガルアライメントを向上させることを目的とする。
  • 制御された学習条件の下で、cT-LASERの性能を多言語および二言語のクロスリンガル転移タスクに対して評価することを目的とする。
  • 距離制約損失が同じ言語の性能を劣化させることなく、クロスリンガル性能を向上させることを示すこと。

提案手法

  • LASERのBiLSTMエンコーダをトランスフォーマー・エンコーダに置き換えることで、並列処理の向上と長距離シーケンスモデリングの向上を実現する。
  • 共通のエンコーダと均一な辞書を用いた多言語ニューラル機械翻訳(NMT)フレームワークを用いてモデルを学習する。
  • 共有ベクトル空間内での平行文の文埋め込み間のL2距離を最小化する距離制約損失を導入する。
  • 翻訳と埋め込みアライメントの両方を同時に最適化するため、エンドツーエンド学習中に標準のNMT翻訳損失と距離制約損失を組み合わせる。
  • 事前学習にはEuroparl平行コーパスを、クロスリンガルドキュメント分類の評価にはMLdocデータセットを用いる。
  • LASER、T-LASER、cT-LASER間の公平な比較を確保するため、学習ハイパーパramータ、バッチサイズ、最適化アルゴリズム、ランダムシードを制御する。

実験結果

リサーチクエスチョン

  • RQ1BiLSTMに比べ、トランスフォーマー基盤のエンコーダは多言語ドキュメント埋め込みモデルの性能と学習速度を向上させることができるか?
  • RQ2NMT目的関数に距離制約損失を追加することで、文埋め込みのクロスリンガルアライメントが向上するか?
  • RQ3ピボット言語が存在しない低リソースまたは二言語設定では、モデルの性能はいかがなっているか?
  • RQ4距離制約損失はクロスリンガル性能を向上させるが、同じ言語の性能を劣化させないか?

主な発見

  • cT-LASERはMLdocベンチマークにおいてLASERより7.2%のクロスリンガル分類精度の向上を達成し、LASERおよび標準T-LASERを著しく上回る。
  • cT-LASERはLASER_6に比べてクロスリンガルタスクで5.1%の性能ギャップを示し、距離制約損失の有効性を裏付けている。
  • トランスフォーマー構造によるGPUの並列処理の向上のおかげで、cT-LASERはLASER_1およびLASER_6よりも高速な学習速度(WPS)を達成している。
  • ピボット言語が存在しない二言語設定において、cT-LASERはクロスリンガル性能を16%以上向上させ、距離制約損失がピボット言語がなくても知識伝達を可能にしていることを示している。
  • cLASER_6では、距離制約損失によりLASER_6に比べてクロスリンガル性能が2.5%向上するが、同じ言語の性能にはほとんど影響を与えない。
  • 距離制約損失による性能向上は、ランダムシードにかかわらず安定しており、トレーニングのランダムネスに対して頑健であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。