Skip to main content
QUICK REVIEW

[論文レビュー] Translation Transformers Rediscover Inherent Data Domains

Maksym Del, Elizaveta Korotkova|arXiv (Cornell University)|Sep 16, 2021
Natural Language Processing Techniques参考文献 21被引用数 5
ひとこと要約

この論文は、明示的なドメインラベルがなくても、NMT Transformer がその隠れ表現にドメイン固有の情報を内蔵し、それを保持することを示している。特に文書レベルでの教師なしクラスタリングにこれらの内部表現を活用することで、XLM-R などの外部事前学習言語モデルを用いる場合と比較して、優れたドメインクラスタリングおよびドメイン適応性能を達成しており、元のラベルで微調整した場合と同等またはそれを上回る性能を発揮する。

ABSTRACT

Many works proposed methods to improve the performance of Neural Machine Translation (NMT) models in a domain/multi-domain adaptation scenario. However, an understanding of how NMT baselines represent text domain information internally is still lacking. Here we analyze the sentence representations learned by NMT Transformers and show that these explicitly include the information on text domains, even after only seeing the input sentences without domains labels. Furthermore, we show that this internal information is enough to cluster sentences by their underlying domains without supervision. We show that NMT models produce clusters better aligned to the actual domains compared to pre-trained language models (LMs). Notably, when computed on document-level, NMT cluster-to-domain correspondence nears 100%. We use these findings together with an approach to NMT domain adaptation using automatically extracted domains. Whereas previous work relied on external LMs for text clustering, we propose re-using the NMT model as a source of unsupervised clusters. We perform an extensive experimental study comparing two approaches across two data scenarios, three language pairs, and both sentence-level and document-level clustering, showing equal or significantly superior performance compared to LMs.

研究の動機と目的

  • NMT Transformer が明示的な監視なしに、その隠れ表現にテキストドメイン情報を暗黙的にエンコードしているかどうかを調査すること。
  • 事前学習言語モデルからのクラスタリングと比較して、NMTモデル表現から得られる教師なしドメインクラスタの品質を評価すること。
  • 外部言語モデルに依存せず、NMTモデル自身が学習したクラスタを再利用することで、NMTのドメイン適応を向上させること。
  • 複数の言語対およびデータ設定(例:ラベル付き混合コーパス、ラベルなし異種コーパスであるParaCrawlなど)において、NMTベースのクラスタリングの有効性を検証すること。

提案手法

  • 平均プooledの文脈的埋め込みを用いて、事前学習済みNMT Transformerエンコーダーの全層から文および文書レベルの表現を抽出する。
  • 主成分分析(PCA)とk-meansクラスタリングを適用し、これらの表現から教師なしドメインクラスタを同定する。
  • 自動的に発見されたクラスタを用いて、NMTモデルをドメイン適応フレームワークで微調整し、XLM-R などの外部モデルによるクラスタリングに依存するのを回避する。
  • 2つのデータ設定(ラベル付き混合コーパスとラベルなしParaCrawlデータ)において、NMT由来クラスタとXLM-R由来クラスタ、および元のコーパスラベルとの性能を比較する。
  • 複数の言語対(例:EN-DE、EN-ET、EN-CS)におけるBLEUスコアを用いてモデル性能を評価し、モデルサイズやクラスタ数の違いによる結果の分析を行う。
  • より小さなNMTモデルを用いたアブレーションスタディにより、提案手法のロバストネスとスケーラビリティを評価する。

実験結果

リサーチクエスチョン

  • RQ1NMT Transformer は、明示的なドメイン監視なしに、その隠れ表現にドメイン固有の情報を学習・保持できるか?
  • RQ2NMT表現からの教師なしドメインクラスタリングの品質は、XLM-R などの事前学習言語モデルからのものと比較してどうか?
  • RQ3NMT由来クラスタはドメイン適応に効果的に利用できるか?元のドメインラベルで微調整した場合と同等またはそれ以上の性能を達成できるか?
  • RQ4NMTベースのクラスタリングの性能は、モデルサイズ、言語対、またはデータの異質性(例:ParaCrawl)に依存するか?

主な発見

  • NMTモデルは、監視なしでも、文書レベルでほぼ完全な一致(ほぼ100%)を達成するように、文と文書の表現を実際のテキストドメインと密接にクラスタリングする。
  • NMTベースのクラスタは、クラスタ純度と翻訳品質の両面でXLM-Rベースのクラスタを上回り、特に文書レベルのクラスタリングで顕著な優位性を示す。
  • 自動抽出されたNMTクラスタに基づくNMTモデルの微調整は、元のコーパスラベルで微調整した場合と同等またはそれを上回る性能を発揮し、特にEN-ETおよびEN-CS翻訳において顕著である。
  • 5倍小さいモデルでも、NMTベースのクラスタリングはXLM-Rと同等の性能を達成しており、ロバストネスとスケーラビリティを示している。
  • DE-EN ParaCrawl設定では、モデル容量が言語対に適している場合、NMTベースのクラスタリングがXLM-Rを顕著に上回る改善を示す。
  • 外部事前学習モデルへの依存を軽減することで、ドメイン適応パイプラインを簡素化しつつ、翻訳品質を維持または向上させている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。