[论文解读] Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback
本文提出通过提示微调后的语言模型以自然语言形式表达置信度分数——无论是数值概率还是表达不确定性的语言表达——相比其原始对数概率,可显著提升预测的校准性。对于 GPT-3.5-turbo、GPT-4 和 Claude 2 等模型,表达置信度可使期望校准误差(ECE)降低超过 50%,尤其是在结合多假设提示时,提供了一种实用的零样本方法,可提升实际部署中的可靠性。
A trustworthy real-world prediction system should produce well-calibrated confidence scores; that is, its confidence in an answer should be indicative of the likelihood that the answer is correct, enabling deferral to an expert in cases of low-confidence predictions. Recent studies have shown that unsupervised pre-training produces large language models (LMs) whose conditional probabilities are remarkably well-calibrated. However, the most widely-used LMs are fine-tuned with reinforcement learning from human feedback (RLHF-LMs), and some studies have suggested that RLHF-LMs produce conditional probabilities that are very poorly calibrated. In light of this perceived weakness, we conduct a broad evaluation of methods for extracting confidence scores from RLHF-LMs. For RLHF-LMs such as ChatGPT, GPT-4, and Claude, we find that verbalized confidences emitted as output tokens are typically better-calibrated than the model's conditional probabilities on the TriviaQA, SciQ, and TruthfulQA benchmarks, often reducing the expected calibration error by a relative 50%.
研究动机与目标
- 为解决强化学习人类反馈(RLHF)微调后语言模型中置信度分数校准性差的问题,这些模型常高估预测的确定性。
- 评估以数字或词语形式表达的置信度分数是否能产生比模型估计的对数概率更优校准性的输出。
- 研究提示策略(如生成多个答案假设)是否能提升表达置信度的校准性。
- 确定零样本提示是否能在无需额外微调的情况下,实现优于模型概率的校准性。
- 评估这些发现在多种模型(如 GPT-3.5-turbo、GPT-4、Claude 2、Llama-2-70b-chat)和基准测试(TriviaQA、SciQ、TruthfulQA)中的泛化能力。
提出的方法
- 通过提示 RLHF 微调后的语言模型在 token 空间中直接输出以自然语言表达的置信度分数,例如 '高度可能' 或 '70% 置信'。
- 采用零样本提示策略,即在分配置信度前提示模型生成多个答案假设,受心理学中减少过度自信技术的启发。
- 使用标准校准度量指标评估表达置信度:期望校准误差(ECE)、Brier 评分(BS)和 ROC 曲线下面积(AUC)。
- 对表达概率进一步应用温度缩放,以提升校准性,尤其适用于 GPT-3.5-turbo 和 GPT-4 等模型。
- 使用保留的校准集优化似然性表达(例如将 '中等可能' 映射为概率值),以提升校准性,该方法称为 'Ling. 1S-opt'。
- 在多个基准和模型上,将表达置信度分数与模型对数概率、熵及其他基线方法进行比较。

实验结果
研究问题
- RQ1对于 GPT-3.5-turbo、GPT-4 和 Claude 2 等 RLHF 微调后的语言模型,通过以自然语言形式表达其不确定性,而非依赖内部对数概率,是否能产生更优校准性的置信度估计?
- RQ2在分配置信度前提示模型生成多个答案假设,是否能提升其表达置信度的校准性?
- RQ3在不同模型和数据集上,表达置信度的数值概率与表达不确定性的语言表达(如 '可能'、'不太可能')的校准性相比如何?
- RQ4温度缩放在多大程度上能提升 RLHF 语言模型中表达置信度分数的校准性?
- RQ5在置信度校准方面,开源模型如 Llama-2-70b-chat 的表达能力与闭源模型(如 GPT-4 和 Claude 2)相比如何?
主要发现
- 在 SciQ 基准测试中,对于 GPT-3.5-turbo、GPT-4 和 Claude 2,表达置信度分数使期望校准误差(ECE)相比模型对数概率降低了超过 50%。
- 在所有评估的模型和基准测试中,表达置信度的数值概率始终比模型对数概率具有更好的校准性,尤其在对抗性 TruthfulQA 数据集上改善最为显著。
- 在分配置信度前生成并评估多个答案假设,可显著提升校准性,使 ECE 相比单假设提示降低高达 50%。
- 温度缩放进一步提升了表达概率的校准性,尤其对 GPT-3.5-turbo 和 GPT-4 效果明显,但不同模型间效果存在差异。
- Claude 2 的表达能力优于 Claude 1,GPT-4 在表达置信度校准方面也优于 GPT-3.5-turbo,尽管两者均优于其自身的对数概率。
- Llama-2-70b-chat 的表达性能弱于闭源模型,但仍优于其对数概率,尤其在 TruthfulQA 上表现突出,表明开源模型仍有优化潜力。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。