Skip to main content
QUICK REVIEW

[論文レビュー] Knowledge Distillation for BERT Unsupervised Domain Adaptation

Minho Ryu, Kichun Lee|arXiv (Cornell University)|Oct 22, 2020
Topic Modeling被引用数 9
ひとこと要約

本稿では、災難的忘却を軽減するため、敵対的ドメイン適応(ADDA)と知識蒸留を組み合わせた、BERT向けの新しい教師なしドメイン適応手法であるAdversarial Adaptation with Distillation(AAD)を提案する。ソースモデルを微調整した重みでターゲットBERTを初期化し、温度制御されたソフトラベル損失を用いた蒸留を適用することで、30のクロスドメインセンチメント分類タスクにおいて最先端の性能を達成し、ベースライン手法よりも平均1.6%の精度向上を達成するとともに、安定性も向上した。

ABSTRACT

A pre-trained language model, BERT, has brought significant performance improvements across a range of natural language processing tasks. Since the model is trained on a large corpus of diverse topics, it shows robust performance for domain shift problems in which data distributions at training (source data) and testing (target data) differ while sharing similarities. Despite its great improvements compared to previous models, it still suffers from performance degradation due to domain shifts. To mitigate such problems, we propose a simple but effective unsupervised domain adaptation method, adversarial adaptation with distillation (AAD), which combines the adversarial discriminative domain adaptation (ADDA) framework with knowledge distillation. We evaluate our approach in the task of cross-domain sentiment classification on 30 domain pairs, advancing the state-of-the-art performance for unsupervised domain adaptation in text sentiment classification.

研究の動機と目的

  • ソースドメインとターゲットドメインの間のドメインシフトによって生じるBERTモデルの性能低下を是正すること。
  • 大規模な事前学習モデル(例:BERT)にADDAフレームワークを適用する際の教師なしドメイン適応における災難的忘却を克服すること。
  • 敵対的適応パイプラインに知識蒸留を統合することで、ドメイン適応の安定性と性能を向上させること。
  • 知識蒸留における温度ハイパーパrameterの影響がモデルの汎化性と頑健性に与える影響を調査すること。

提案手法

  • ソースエンコーダーの微調整済み重みでターゲットエンコーダーを初期化することで、ADDAフレームワークをBERTに適応する。
  • ターゲットエンコーダーとドメイン識別器の間で敵対的訓練を実行し、ドメイン差を最小化する。
  • ソースモデルからのソフトラベルを用いてターゲットモデルの予測を正則化する知識蒸留を適用する。
  • 蒸留中に確率分布をなめらかにするために、温度スケーリング付きの交差エントロピー損失を使用する。
  • 敵対的ドメイン損失と蒸留損失を組み合わせた損失関数を用いて、ターゲットBERTと分類器を同時に学習する。
  • 2段階のプロセスでターゲットモデルを最適化する:まず敵対的ドメイン整合を実施し、その後に蒸留に基づく正則化を実施する。

実験結果

リサーチクエスチョン

  • RQ1教師なしドメイン適応において、ラベルなしのターゲットデータを用いてBERTを新しいドメインに適応する際、知識蒸留が災難的忘却を効果的に防止できるか。
  • RQ2知識蒸留における温度ハイパーパrameterが、適応されたBERTモデルの性能と安定性に与える影響は何か。
  • RQ3敵対的ドメイン適応と知識蒸留を組み合わせることで、BERTベースのセンチメント分類において、既存の教師なしドメイン適応手法を上回る性能が得られるか。
  • RQ4本手法は、さまざまなドメインペアに対して、ベースライン手法よりも安定性に優れているか。

主な発見

  • AADは30のクロスドメインセンチメント分類ペアのうち21でベースラインを大きく上回り、平均して1.6%の精度向上を達成した。
  • 本手法は優れた安定性を示し、他の手法と比較して実験全体で標準偏差が常に低かった。
  • 温度20での知識蒸留が最良の性能を示したが、より高い温度(例:50)ではラベル情報が過剰になめらかになり、性能が低下した。
  • t=1以外のすべての温度値において、教師あり微調整ベースラインは知識蒸留に劣っており、蒸留による正則化効果が明確に示された。
  • DDC や DANN といった既存手法は平均的にベースラインを下回っており、標準的なドメイン適応手法をBERTに適用する際の限界を示している。
  • deep CORAL手法はDDC や DANN よりも優れていたが、AADに平均1.1%の性能差をつけていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。