Skip to main content
QUICK REVIEW

[論文レビュー] Improving BERT Fine-tuning with Embedding Normalization

Wenxuan Zhou, Junyi Du|arXiv (Cornell University)|Nov 10, 2019
Topic Modeling参考文献 9被引用数 4
ひとこと要約

この論文は、BERTの[CLS]トークンに偏った埋め込み分布が存在することを特定した—つまり、活性化が一部の次元に集中しており、ゼロ中心化が欠落している—これが微調整中の最適化不安定性を引き起こしている。これを解決するために、[CLS]埋め込みを再中心化・正規化する単純な埋め込み正規化手法を提案し、アーキテクチャの変更なしに複数のテキスト分類タスクで性能向上を達成した。

ABSTRACT

Large pre-trained sentence encoders like BERT start a new chapter in natural language processing. A common practice to apply pre-trained BERT to sequence classification tasks (e.g., classification of sentences or sentence pairs) is by feeding the embedding of [CLS] token (in the last layer) to a task-specific classification layer, and then fine tune the model parameters of BERT and classifier jointly. In this paper, we conduct systematic analysis over several sequence classification datasets to examine the embedding values of [CLS] token before the fine tuning phase, and present the biased embedding distribution issue---i.e., embedding values of [CLS] concentrate on a few dimensions and are non-zero centered. Such biased embedding brings challenge to the optimization process during fine-tuning as gradients of [CLS] embedding may explode and result in degraded model performance. We further propose several simple yet effective normalization methods to modify the [CLS] embedding during the fine-tuning. Compared with the previous practice, neural classification model with the normalized embedding shows improvements on several text classification tasks, demonstrates the effectiveness of our method.

研究の動機と目的

  • 微調整前のBERTの[CLS]トークン埋め込みの分布的性質を調査すること。
  • 偏った、ゼロ中心でない[CLS]埋め込みが微調整中の最適化を妨げることを特定すること。
  • 訓練の安定化とシーケンス分類タスクにおけるパフォーマンス向上を図る正規化手法を提案すること。
  • 複数のベンチマークテキスト分類データセットを用いて、正規化された[CLS]埋め込みの有効性を評価すること。

提案手法

  • 微調整前の複数のシーケンス分類データセットにおける[CLS]トークン埋め込み分布の分析。
  • 微調整中に[CLS]埋め込みベクトルにバッチ正規化やレイヤー正規化などの正規化手法を適用する。
  • バッチ全体における[CLS]埋め込みの平均を引くことで、[CLS]埋め込みを再中心化する。
  • 分類ヘッドの入力に変更を加え、分類器に供給する前に[CLS]表現を正規化する。
  • BERTのアーキテクチャや事前学習を変更せずに、軽量なポストプロセッシングステップとして正規化を統合する。
  • 標準ベンチマークを用いて、正規化の影響が下流分類パフォーマンスに与える影響を評価する。

実験結果

リサーチクエスチョン

  • RQ1BERTのシーケンス分類タスクにおける[CLS]トークン埋め込みは、微調整前にどのように分布しているか?
  • RQ2[CLS]埋め込みのゼロ中心でない、集中した分布は、微調整の最適化にどの程度悪影響を及えるか?
  • RQ3[CLS]埋め込みの単純な正規化が、微調整の安定性とモデルパフォーマンスの向上に寄与するか?
  • RQ4複数のテキスト分類データセットにおいて、正規化は標準的な微調整と比べてどのように差をつけるか?

主な発見

  • [CLS]トークン埋め込みは、微調整前に一部の次元に高濃度に集中しており、ゼロ中心でない偏った分布を示している。
  • この偏った分布は、微調整中に不安定な勾配と性能低下を引き起こす。
  • バッチ再中心化やレイヤー正規化などの正規化手法は、最適化プロセスを効果的に安定化する。
  • 提案手法は、標準的な微調整と比較して、複数のテキスト分類ベンチマークで一貫した改善を達成した。
  • アーキテクチャの変更や追加パラメータなしに、軽量かつ実装可能な方法で成果が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。