Skip to main content
QUICK REVIEW

[論文レビュー] Word Alignment by Fine-tuning Embeddings on Parallel Corpora

Zi-Yi Dou, Graham Neubig|arXiv (Cornell University)|Jan 20, 2021
Natural Language Processing Techniques参考文献 76被引用数 12
ひとこと要約

本稿では、並列コーパス上でアラインメント固有の目的関数を用いて多言語的文脈依存埋め込みをファインチューニングするAWESoMEを提案する。5つの言語対において、先行する最先端手法を顕著に上回る性能を発揮する。単語レベルの類似性と文レベルの並列性を同時に最適化することで、アラインメント品質を向上させ、確率しきい値法や最適輸送を用いた効果的な抽出手法により、ロバストなゼロショット性能を実現する。

ABSTRACT

Word alignment over parallel corpora has a wide variety of applications, including learning translation lexicons, cross-lingual transfer of language processing tools, and automatic evaluation or analysis of translation outputs. The great majority of past work on word alignment has worked by performing unsupervised learning on parallel texts. Recently, however, other work has demonstrated that pre-trained contextualized word embeddings derived from multilingually trained language models (LMs) prove an attractive alternative, achieving competitive results on the word alignment task even in the absence of explicit training on parallel data. In this paper, we examine methods to marry the two approaches: leveraging pre-trained LMs but fine-tuning them on parallel text with objectives designed to improve alignment quality, and proposing methods to effectively extract alignments from these fine-tuned models. We perform experiments on five language pairs and demonstrate that our model can consistently outperform previous state-of-the-art models of all varieties. In addition, we demonstrate that we are able to train multilingual word aligners that can obtain robust performance on different language pairs. Our aligner, AWESOME (Aligning Word Embedding Spaces of Multilingual Encoders), with pre-trained models is available at https://github.com/neulab/awesome-align

研究の動機と目的

  • 事前学習済みの多言語的文脈依存埋め込みと並列コーパスにおけるファインチューニングを組み合わせることで、単語アラインメント性能を向上させること。
  • 対応する単語と並列文の表現を近づけるように促す訓練目的を設計し、アラインメント品質を向上させること。
  • ファインチューニング済みの文脈依存埋め込みからアラインメントを効果的に抽出する手法を開発すること。
  • 1つの多言語アラインヤーを用いて、ターゲット言語でファインチューニングを行わずに多様な言語対でロバストなゼロショット性能を実現すること。
  • 利用可能な教師信号を統合することで、半教師あり学習を支援すること。

提案手法

  • アラインメント固有の目的関数を用いて、並列コーパス上で多言語的BERT風モデルをファインチューニングし、対応する単語ペアの文脈依存表現がより類似するよう促進する自己学習目的を採用する。
  • ソース文とターゲット文のペアの表現を引き寄せる平行文同定目的を導入する。
  • 文脈依存単語埋め込み間のコサイン類似度をアラインメント予測の根拠とする。
  • 確率しきい値法と最適輸送を用いて、ファインチューニング済みモデル出力からロバストで一方向のアラインメントを抽出する。
  • マスク言語モデルとアラインメント固有の目的関数の組み合わせを用いて、エンドツーエンドでモデルを訓練する。
  • AER(平均誤差率)などの標準的指標を用いて、複数の言語対でアラインメント品質を評価する。

実験結果

リサーチクエスチョン

  • RQ1並列コーパス上で多言語的文脈依存埋め込みをファインチューニングすることで、教師なし手法を上回る単語アラインメント性能を達成できるか?
  • RQ2単語レベルのアラインメントと文レベルの並列性の両方を同時に最適化する目的関数は、アラインメントタスクの表現品質を向上させられるか?
  • RQ31つの多言語モデルが、トレーニング時に見なかった言語対に対してもゼロショットで一般化できるか?
  • RQ4異なるアラインメント抽出手法(しきい値法 vs. 最適輸送)の性能とロバスト性は、どのように比較できるか?
  • RQ5モデルは、半教師あり設定において、教師信号を効果的に統合できるか?

主な発見

  • AWESoMEは、5つの多様な言語対で最先端の性能を達成し、すべての設定で先行手法を一貫して上回る。
  • モデルはロバストなゼロショット性能を示し、トレーニング時に見なかった言語対に対しても良好に一般化する。
  • アラインメント固有の目的関数によるファインチューニングにより、対応する単語間のコサイン距離が短縮され、よりアラインメントに近い文脈依存表現が得られることが示された。
  • 最適輸送に基づくアラインメント抽出は、ほとんどの場合、単純な確率しきい値法よりもより正確な結果をもたらす。
  • モデルは、多言語的文の表現転送性能を向上させ、多言語自然言語推論のXNLIベンチマークでもベースラインを上回った。
  • 教師信号を統合することで、半教師あり学習が有効に実現され、さらにアラインメント精度が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。