[論文レビュー] Calibrated Language Model Fine-Tuning for In- and Out-of-Distribution Data
この論文は、特徴空間内挿補を用いたマニフォールド上正則化と、大規模摂動を用いたマニフォールド外正則化の2つの新しい正則化項を導入することで、分布内および分布外(OOD)データの両方におけるキャリブレーションを向上させる正則化された微調整手法を提案する。この手法は、期待キャリブレーション誤差(ECE)を顕著に低減し、6つのデータセットにおいてOOD検出性能も向上させる。
Fine-tuned pre-trained language models can suffer from severe miscalibration for both in-distribution and out-of-distribution (OOD) data due to over-parameterization. To mitigate this issue, we propose a regularized fine-tuning method. Our method introduces two types of regularization for better calibration: (1) On-manifold regularization, which generates pseudo on-manifold samples through interpolation within the data manifold. Augmented training with these pseudo samples imposes a smoothness regularization to improve in-distribution calibration. (2) Off-manifold regularization, which encourages the model to output uniform distributions for pseudo off-manifold samples to address the over-confidence issue for OOD data. Our experiments demonstrate that the proposed method outperforms existing calibration methods for text classification in terms of expectation calibration error, misclassification detection, and OOD detection on six datasets. Our code can be found at https://github.com/Lingkai-Kong/Calibrated-BERT-Fine-Tuning.
研究の動機と目的
- 微調整された事前学習済み言語モデルが分布内および分布外データにおいて著しくキャリブレーションがずれている問題を解決すること。
- 分布内入力の予測確率が真の尤度を的確に反映するようにすることで、モデルの信頼性を向上させること。
- 分布外入力に対する過信を軽減するために、出力確率分布を均一化するように促すことで、予測の過信を低減すること。
- データ拡張に基づく正則化を通じて過学習を緩和し、一般化性能を向上させること。
- 推論コストを増加させることなく、後処理キャリブレーションやベイジアン手法を凌駕するスケーラブルなトレーニング時ソリューションを提供すること。
提案手法
- 訓練データの隠れ特徴空間における線形内挿を用いて、擬似サンプルを生成することでマニフォールド上正則化を導入する。
- これらの内挿されたサンプルを用いて、データマニフォールド内でのモデルの意思決定境界に滑らかさの制約を課す。
- データマニフォールドから遠く離れた摂動を生成することで、マニフォールド外正則化を適用し、分布外入力に対する出力確率を均一化するように促進する。
- 交差エントロピー損失に加えて両正則化項を組み合わせた共同目的関数を最適化することで、分布内およびOODの両方のキャリブレーションをバランスさせる。
- 2段階の最適化プロセスを採用:まず内側のミニマックス問題を解いてロバストな擬似サンプルを生成し、その後、正則化された損失関数を用いた標準的な微調整を行う。
- 両正則化項のハイパーパrameterを同時に最適化することで、キャリブレーション性能に補完的効果をもたらすように調整する。
実験結果
リサーチクエスチョン
- RQ1マニフォールド上内挿によるデータ拡張は、微調整された言語モデルの分布内キャリブレーションを向上させることができるか?
- RQ2マニフォールド外正則化は、分布外入力に対する予測の過信を効果的に低減させることができるか?
- RQ3両正則化項を組み合わせることで、個別の成分やベースライン手法よりも優れた全体的なキャリブレーションが達成できるか?
- RQ4マニフォールド上およびマニフォールド外正則化のハイパーパrameterはどのように相互作用するのか?また、同時に最適化する必要があるのか?
- RQ5この手法は、推論コストを増加させることなく、分布内キャリブレーションおよびOOD検出の両面で最先端の性能を達成できるか?
主な発見
- 提案手法は、20NG 15におけるBERTベースラインと比較して、期待キャリブレーション誤差(ECE)を最大60%まで低減し、9.24%から3.69%に低下させた。
- 20NGデータセットでは、両正則化項を適用することで、OOD検出のAUCがBERTの21.65%から63.92%に向上し、強力なOOD一般化性能を示した。
- マニフォールド外正則化を除去すると、OOD AUCが20.05%低下(63.92%から43.87%に)し、これがOODキャリブレーションにおいて極めて重要な役割を果たしていることを実証した。
- マニフォールド上正則化のみを適用した場合、20NGデータセットでECEが5.00%まで低下し、分布内キャリブレーションの向上効果が明確に示された。
- 両正則化項のハイパーパramータを同時に最適化することが不可欠であり、アブレーション実験から、各成分を個別に除去または最適化した場合、性能が劣化することが確認された。
- 6つの多様なテキスト分類データセットにおいて、ECEおよびOOD検出性能の両面で、既存のキャリブレーションベースラインを上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。