Skip to main content
QUICK REVIEW

[論文レビュー] Feature Adaptation of Pre-Trained Language Models across Languages and Domains with Robust Self-Training

Hai Ye, Qingyu Tan|arXiv (Cornell University)|Sep 24, 2020
Topic Modeling参考文献 48被引用数 5
ひとこと要約

本稿では、微調整を伴わずに新しいドメインや言語に事前学習済み言語モデル(PrLM)の特徴を適応させる自己訓練手法として、クラスに特化した特徴自己蒸留(CFd)を提案する。相互情報量を同時に最大化し、クラス内特徴距離を最小化することで、誤りのある疑似ラベルの影響を軽減し、Amazonレビューデータセットにおけるクロスドメインおよびマルチリンガルセンチメント分類タスクで一貫した精度向上を達成する。

ABSTRACT

Adapting pre-trained language models (PrLMs) (e.g., BERT) to new domains has gained much attention recently. Instead of fine-tuning PrLMs as done in most previous work, we investigate how to adapt the features of PrLMs to new domains without fine-tuning. We explore unsupervised domain adaptation (UDA) in this paper. With the features from PrLMs, we adapt the models trained with labeled data from the source domain to the unlabeled target domain. Self-training is widely used for UDA which predicts pseudo labels on the target domain data for training. However, the predicted pseudo labels inevitably include noise, which will negatively affect training a robust model. To improve the robustness of self-training, in this paper we present class-aware feature self-distillation (CFd) to learn discriminative features from PrLMs, in which PrLM features are self-distilled into a feature adaptation module and the features from the same class are more tightly clustered. We further extend CFd to a cross-language setting, in which language discrepancy is studied. Experiments on two monolingual and multilingual Amazon review datasets show that CFd can consistently improve the performance of self-training in cross-domain and cross-language settings.

研究の動機と目的

  • 事前学習済み言語モデル(PrLM)を微調整せずに新しいドメインや言語に適応する課題に対処すること。
  • 誤りのある疑似ラベルの悪影響を軽減することで、自己訓練の耐性を向上させ、教師なしドメイン適応(UDA)における性能を改善すること。
  • クラスに特化した自己蒸留を通じて、PrLMから特徴を学習する特徴適応モジュール(FAM)を開発すること。
  • 複数の言語を共有の意味的空間にマップするXLM-Rを用いて、マルチリンガル設定への拡張を図ること。
  • CFdが理想の結合仮説の誤差を低減することを実証的に検証し、一般化性能の向上を示すこと。

提案手法

  • 事前学習済み言語モデル(PrLM)の特徴を特徴適応モジュール(FAM)に自己蒸留するクラスに特化した特徴自己蒸留(CFd)を提案し、特徴の識別性を向上させること。
  • PrLM特徴とFAM特徴の間の相互情報量(MI)を最大化することで、FAMが高レベルの意味的表現を捉えるように保証すること。
  • FAM出力におけるクラス内特徴距離を最小化することで、クラスクラスタをより緊密にし、クラス間分離性を向上させること。
  • 高信頼度の疑似ラベル予測を優先するリランキング戦略を用い、ターゲットドメインにおけるクラス分布のバランスを取ること。
  • PrLMの最後のN層に注目機構を統合することで、中間特徴を効果的に統合し、単純な平均化を上回る性能を達成すること。
  • XLM-Rを用いてマルチリンガル設定にCFdを拡張し、多言語の意味的表現空間を活用することで、言語間での適応を可能にすること。

実験結果

リサーチクエスチョン

  • RQ1微調整を伴わず、事前学習済み言語モデルを用いた自己訓練の耐性を、特徴自己蒸留によって向上させることができるか?
  • RQ2特徴蒸留にクラスに特化したクラスタリングを組み込むことで、ターゲットドメインにおけるモデルの一般化性能と誤差低減にどのような影響を与えるか?
  • RQ3マルチリンガル事前学習済みモデルを用いた場合、CFdはどれほどクロスリンガルおよびクロスドメインセンチメント分類の性能向上に寄与するか?
  • RQ4PrLMの複数層に注目機構を適用することで、単一層や平均層統合と比較して、特徴表現がどのように向上するか?
  • RQ5理想の結合仮説の誤差低減において、CFdはベースライン自己訓練および他の蒸留手法と比較して、どの程度優れているか?

主な発見

  • CFdは、MonoAmazonおよびMultiAmazonデータセットにおけるすべてのクロスドメインおよびクロスリンガル設定で、自己訓練の性能を一貫して向上させる。
  • MonoAmazonデータセットでは、BK→Mのクロスドメイン設定で70.95%の精度を達成し、ベースライン(66.59%)およびFdオンリーバリエーション(70.16%)を上回る。
  • 理想の仮説の結合誤差がCFdによって低減され、特にBK→M設定で最小の誤差が観測され、一般化性能の向上が確認された。
  • クラス内損失は、ベースラインの966.38からCFdでは12.17に劇的に低下し、FAM特徴空間におけるクラスクラスタの緊密さが向上したことを示している。
  • A-distance指標では、p+CFdが最小のドメイン不一致(0.22)を示し、ドメイン整合性が高く、ドメインシフトが軽減されたことを示している。
  • XLM-Rの最後の10層に注目機構を適用したCFdが、最も高い性能を示し、単一層および平均層(AVE)統合戦略を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。