Skip to main content
QUICK REVIEW

[論文レビュー] On the Domain Adaptation and Generalization of Pretrained Language Models: A Survey

Xu Guo, Han Yu|arXiv (Cornell University)|Nov 6, 2022
Topic Modeling被引用数 14
ひとこと要約

本調査は、事前学習言語モデル(PLM)のドメイン適応(DA)手法について体系的な分類を提供し、データ拡張、モデル最適化、パーソナライゼーションの3つに技術を分類している。LoRA やプロンプトチューニングといったパrameter効率の良い手法が、低リソースまたはドメイン外の設定にPLMを適応させる際の性能低下や深刻な忘却を軽減する有効な解決策であると強調している。

ABSTRACT

Recent advances in NLP are brought by a range of large-scale pretrained language models (PLMs). These PLMs have brought significant performance gains for a range of NLP tasks, circumventing the need to customize complex designs for specific tasks. However, most current work focus on finetuning PLMs on a domain-specific datasets, ignoring the fact that the domain gap can lead to overfitting and even performance drop. Therefore, it is practically important to find an appropriate method to effectively adapt PLMs to a target domain of interest. Recently, a range of methods have been proposed to achieve this purpose. Early surveys on domain adaptation are not suitable for PLMs due to the sophisticated behavior exhibited by PLMs from traditional models trained from scratch and that domain adaptation of PLMs need to be redesigned to take effect. This paper aims to provide a survey on these newly proposed methods and shed light in how to apply traditional machine learning methods to newly evolved and future technologies. By examining the issues of deploying PLMs for downstream tasks, we propose a taxonomy of domain adaptation approaches from a machine learning system view, covering methods for input augmentation, model optimization and personalization. We discuss and compare those methods and suggest promising future research directions.

研究の動機と目的

  • ドメインシフトや分布不一致のため、事前学習言語モデル(PLM)がドメイン外または低リソース設定に適用された際に生じる性能低下を解消すること。
  • 従来の非事前学習モデル向けに設計された手法とは異なり、PLMに特化して開発されたドメイン適応技術を特定・分類すること。
  • 実用的なPLMの展開を目的として、入力の増強、モデル最適化、パーソナライゼーションに焦点を当てた、機械学習システム指向の体系的で包括的なDA手法の分類を構築すること。
  • 研究者や実務家が、深刻な忘却を回避し、実世界のNLP応用における汎化性能を向上させるために、適切なDA手法を選択または組み合わせるのを支援すること。
  • スケーラブルでユーザー固有のPLM展開を可能にする分野として、未だ十分に検討されていないが有望な方向性、例えばパーソナライズド適応や生涯学習を浮き彫りにすること。

提案手法

  • 3段階の分類体系を提案:(1) 入力レベルのデータ拡張、(2) モデルレベルの最適化(例:アダプタ、LoRA、プロンプトチューニング)、(3) ユーザーレベルのパーソナライゼーション。
  • ドメイン固有のファインチューニング、敵対的ドメイン適応、パrameter効率の良い適応(例:LoRA、プロンプトチューニング、アダプタ)といった手法をレビュー・比較する。
  • ドメイン不変のデータサンプリングやバックトランスレーションを含む入力レベルの増強の有効性を分析し、元のドメインとターゲットドメイン間の分布ギャップを埋める。
  • 事前学習済みパラメータを固定し、わずかなサブセット(例:アダプタ、LoRA)のみをファインチューニングするモデル最適化戦略を検討し、忘却の軽減とデータ効率の向上を図る。
  • 事後適応やインクリメンタル学習といったパーソナライゼーション手法を評価し、再学習を必要とせずに個々のユーザーの好みに応じたモデル更新を可能にする。
  • AdaptSum、MultiWOZ、WNUT2016、BioNLP、Amazonレビューといったベンチマークデータセットをレビューし、多様なNLPタスクにおけるクロスドメイン性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1大規模な事前学習言語モデルは従来のニューラルネットワークとは根本的に異なる挙動を示すが、その特性に適合したドメイン適応手法はどのように設計できるか?
  • RQ2従来のドメイン適応手法とPLMに特化して設計された手法の主な違いは何か? また、なぜ一部の従来手法(例:ドメイン敵対的トレーニング)はPLMでは機能しないのか?
  • RQ3LoRA やプロンプトチューニング、アダプタといったパrameter効率の良い手法は、元のドメインとターゲットドメインの両方で性能を維持しながら、深刻な忘却をどの程度軽減できるか?
  • RQ4パーソナライゼーション手法は、進化するドメインに応じてユーザーごとに継続的かつインタラクティブに適応可能なPLMの生涯的学習をどのように実現できるか?
  • RQ5特定のドメイン適応手法が低リソースまたはドメイン外の設定でより効果的である理由となる、重要な設計選択やメカニズムは何か?

主な発見

  • LoRA やプロンプトチューニングといったパrameter効率の良い手法は、完全なファインチューニングと同等の性能を達成しながら、トレーニング可能なパラメータ数を著しく削減し、深刻な忘却を軽減する。
  • アダプタベースのチューニングは、低リソースおよびクロスリンガル設定において完全なファインチューニングよりも忘却に強いことが示され、データ不足下での一般化性能に優れている。
  • プロンプトチューニングは、少データ設定(few-shot)では完全なファインチューニングに劣る性能を示しており、現在のプロンプトベース手法が、さらなるアーキテクチャ的・最適化的改善なしには低リソース適応に最適でない可能性を示唆している。
  • バックトランスレーションや合成データ生成を含むドメイン固有のデータ拡張は、事前学習段階とターゲットドメイン間の分布シフトを軽減することで、クロスドメイン性能を向上させる。
  • 事後適応のようなパーソナライゼーション手法は、最小限の再学習でインクリメンタルかつユーザー固有のモデル更新を可能にし、バーチャルアシスタントのようなインタラクティブシステムに適している。
  • ドメイン適応の有効性は、ターゲットドメインが事前学習データにどの程度適切に表現されているかに強く依存しており、PLMの事前学習におけるコーパスの多様性の重要性を強調している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。