Skip to main content
QUICK REVIEW

[論文レビュー] Uncertainty Estimation for Language Reward Models

Adam Gleave, Geoffrey Irving|arXiv (Cornell University)|Mar 14, 2022
Topic Modeling被引用数 7
ひとこと要約

この論文は、微調整された事前学習モデルを用いた言語報酬モデルにおける不確実性推定について、アンサンブル手法(特に、微調整済み事前学習モデルの最終層をランダムに再初期化したブートストラップアンサンブル)を用いて調査している。他の分野では優れた先行性能を示しているが、アンサンブルはアクティブラーニング性能が低く、エピステミック不確実性とモデル誤差との間の相関が弱く、微調整が同一の事前学習モデルから行われるためアンサンブルメンバー間の多様性が限定的であることが示唆される。

ABSTRACT

Language models can learn a range of capabilities from unsupervised training on text corpora. However, to solve a particular problem (such as text summarization) it is typically necessary to fine-tune them on a task-specific dataset. It is often easier for humans to choose between options than to provide labeled data, and prior work has achieved state-of-the-art performance by training a reward model from such preference comparisons. However, collecting a large preference comparison dataset is still expensive -- and the learned reward models are unreliable out-of-distribution. We seek to address these problems via uncertainty estimation, which can improve sample efficiency and robustness using active learning and risk-averse reinforcement learning (RL). Specifically, we use bootstrap aggregating (bagging) to train an ensemble of reward models differing in the initialization of their final layer. Ensembles have proved successful in prior applications of active learning, but we find that in our setting ensemble active learning does not outperform random sampling. Further experiments show that while the aggregate predictions are well-calibrated, the ensemble's estimated epistemic uncertainty is only weakly correlated with model error. We suspect this is because the ensemble members are fine-tuned from a single model and so are similar to one another. This suggests current pre-training methods will need to be modified to support uncertainty estimation, e.g. by training multiple language models.

研究の動機と目的

  • 不確実性推定を用いて、言語報酬モデルの学習におけるサンプル効率とロバスト性を向上させること。
  • 微調整された好み比較データを用いた報酬モデルに対して、アンサンブル手法が信頼できる不確実性推定を提供できるかどうかを調査すること。
  • 人間の好みラベルの収集コストを削減するために、不確実性に基づくアクティブラーニングの有効性を評価すること。
  • 微調整済み事前学習言語モデルの文脈でアンサンブル不確実性推定が性能を発揮しない理由を診断すること。
  • 微調整の効率性と不確実性推定の品質の間のトレードオフを、モデル多様性の制限を踏まえて探ること。

提案手法

  • 微調整済みの好み比較データ上で、各モデルの最終層をランダムに再初期化することで、言語報酬モデルのアンサンブルを訓練する。
  • ブートストラップアンサンブル(バギング)を用い、各アンサンブルメンバーのための多様な訓練サブセットを生成することで、不確実性推定を改善する。
  • 各入力について、アンサンブル予測の分散を用いてエピステミック不確実性を推定する。
  • ホールドアウトデータ上の実際のモデル誤差と不確実性推定値のスピアマン順位相関を用いて、不確実性の質を評価する。
  • アクティブラーニングにおいて、不確実性に基づく取得(例:分散)とランダムサンプリングを比較する。
  • 合成および実世界の要約データセットを用いて、アンサンブル予測および不確実性推定のキャリブレーションを評価する。

実験結果

リサーチクエスチョン

  • RQ1アンサンブルベースの不確実性推定は、ランダムサンプリングに比べて、言語報酬モデルの学習におけるアクティブラーニング性能を向上させることができるか?
  • RQ2アンサンブル分散による不確実性推定は、分布外および分布内入力における実際のモデル誤差とどの程度相関しているか?
  • RQ3アンサンブルサイズおよびモデルパラメータ数は、不確実性推定の質にどのような影響を与えるか?
  • RQ4他の機械学習応用分野で成功しているにもかかわらず、この設定ではなぜアンサンブル不確実性推定が性能を発揮しないのか?
  • RQ5同一の事前学習モデルから微調整されることで、アンサンブルメンバー間の多様性がどの程度制限され、不確実性推定に影響を与えるか?

主な発見

  • アンサンブルベースのアクティブラーニングは、言語報酬モデルの好みラベル付けにおいてランダムサンプリングを上回らない。
  • 推定されたエピステミック不確実性と実際のモデル誤差とのスピアマン相関は低く、最大で r = 0.36 にとどまり、モデル誤差の分散の13%しか説明できない。
  • アンサンブルサイズが大きくなるにつれて不確実性の質がわずかに向上し、3メンバーでは r = 0.25 から42メンバーでは r = 0.36 に上昇するが、改善は限定的である。
  • トレーニング中にブートストラップを適用しても、不確実性の質にわずかな、かつ有意でない改善しか得られず、アンサンブルサイズがサンプリング戦略よりも重要であることが示唆される。
  • 性能の低さは、すべてのメンバーが同一の事前学習モデルから微調整されているため、メンバー間の多様性が低く、意味のある不確実性を捉える能力が制限されていることに起因する。
  • 結果から、微調整によるサンプル効率と信頼できる不確実性推定の間には根本的なトレードオフがあることが示唆され、多様性を内蔵する代替の事前学習やアンサンブル戦略の開発が求められる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。