Skip to main content
QUICK REVIEW

[論文レビュー] Uncertainty Quantification with Pre-trained Language Models: A Large-Scale Empirical Analysis

Yuxin Xiao, Paul Pu Liang|arXiv (Cornell University)|Oct 10, 2022
Natural Language Processing Techniques被引用数 4
ひとこと要約

本稿は、事前学習言語モデル(PLM)における不確実性の定量化に関する大規模な実証的調査を提示しており、PLMアーキテクチャ、サイズ、不確実性の定量化手法、ファインチューニング損失といった主要な設計選択を評価している。その結果、ELECTRAにFocal Lossによるファインチューニングを適用し、Temp Scalingによる再キャリブレーションを施し、さらに大きなモデルサイズを採用することで、ドメイン内およびドメイン外の設定下で、あらゆるNLP分類タスクにおいて最良のキャリブレーションが達成されることが判明した。

ABSTRACT

Pre-trained language models (PLMs) have gained increasing popularity due to their compelling prediction performance in diverse natural language processing (NLP) tasks. When formulating a PLM-based prediction pipeline for NLP tasks, it is also crucial for the pipeline to minimize the calibration error, especially in safety-critical applications. That is, the pipeline should reliably indicate when we can trust its predictions. In particular, there are various considerations behind the pipeline: (1) the choice and (2) the size of PLM, (3) the choice of uncertainty quantifier, (4) the choice of fine-tuning loss, and many more. Although prior work has looked into some of these considerations, they usually draw conclusions based on a limited scope of empirical studies. There still lacks a holistic analysis on how to compose a well-calibrated PLM-based prediction pipeline. To fill this void, we compare a wide range of popular options for each consideration based on three prevalent NLP classification tasks and the setting of domain shift. In response, we recommend the following: (1) use ELECTRA for PLM encoding, (2) use larger PLMs if possible, (3) use Temp Scaling as the uncertainty quantifier, and (4) use Focal Loss for fine-tuning.

研究の動機と目的

  • 安全を要するNLPアプリケーションにおける、良好にキャリブレートされたPLMベースの予測パイプラインを構築するための最適な設定を同定すること。
  • PLMアーキテクチャ、サイズ、不確実性の定量化手法、ファインチューニング損失といった異なる選択肢が、多様なNLPタスクにおけるキャリブレーション誤差に与える影響を調査すること。
  • ドメインシフト下でのパイプラインのパフォーマンスを評価し、分布外設定下での頑健性と信頼性を検証すること。
  • 3つのNLPタスクおよびドメイン内・ドメイン外の設定において、大規模な実証的評価に基づく実用的かつ実行可能な提言を提供すること。

提案手法

  • センチメント分析、自然言語推論、共通認識推論の3つのNLP分類タスクにおいて、大規模な実証的評価を実施した。
  • PLMアーキテクチャ、サイズ、不確実性の定量化手法、ファインチューニング損失の異なる組み合わせを含む、合計120の異なるPLMベースのパイプラインを評価した。
  • ドメインシフト下でのキャリブレーションの頑健性を評価するために、ドメイン内およびドメイン外のテストセットを用いた。
  • 期待キャリブレーション誤差(ECE)、最大平均キャリブレーション誤差(MMCE)、および選択的予測性能を用いてキャリブレーションを測定した。
  • 未学習ドメインにおける検出能力を評価するため、FAR95(95%再現率における誤報率)を用いて不確実性の信頼性を評価した。
  • Post-hocキャリブレーションとしてTemp Scalingを適用し、MCドロップアウトおよびアンサンブル手法と比較した。

実験結果

リサーチクエスチョン

  • RQ1どの事前学習言語モデルアーキテクチャが、多様なNLPタスクおよびドメインシフト下で、最も一貫性のあるキャリブレーション性能を示すか?
  • RQ2モデルサイズは、ドメイン内およびドメイン外の両設定下で、キャリブレーション品質にどのように影響するか?
  • RQ3不確実性の定量化手法(例:Temp Scaling、MCドロップアウト、アンサンブル)の中で、PLMベースのパイプラインにおけるキャリブレーション誤差を最も効果的に低減するのはどれか?
  • RQ4ファインチューニング損失(例:交差エントロピー、Focal Loss、ラベルスムージング、Brier損失、MMCE)の中で、タスクおよびドメインをまたいでより良好なキャリブレーションを達成するのはどれか?

主な発見

  • ELECTRAは、3つのタスクおよびドメイン内・ドメイン外の両設定下で、他のPLMと比較して一貫して優れたキャリブレーション品質を示した。
  • 大きなPLMは、特に共通認識推論タスクにおいて顕著に優れたキャリブレーションを達成し、小さなバージョンと比較してドメイン内でのキャリブレーションが顕著に向上した。
  • Focal Lossは、ドメイン内およびドメイン外の両評価で期待キャリブレーション誤差(ECE)を最低水準に抑え、FAR95スコアも最高を記録し、優れたドメイン外検出能力を示した。
  • Temp Scalingは、特にドメイン外シナリオにおいて、キャリブレーション誤差を顕著に低減する最も効果的なpost-hoc不確実性定量化手法であった。
  • アンサンブル手法は、従来のモデルでは成功を収めたが、PLMベースのパイプラインではキャリブレーション誤差の低減にあまり効果がなかった。
  • ラベルスムージングおよびBrier損失はドメイン外キャリブレーションを改善したが、ECEを低く保ちつつ高い検出性能を維持する点で、Focal Lossに比べて劣っていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。