[论文解读] Llamas Know What GPTs Don't Show: Surrogate Models for Confidence Estimation
本文提出一种代理模型方法,用于估计 GPT-4 和 Claude-v1.3 等前沿黑箱大语言模型的置信度,这些模型不暴露内部概率。通过使用同一输入下较弱的开源模型(如 Llama 2)的置信度分数,该方法在 12 个问答数据集上实现了 84.6% 的平均 AUC,优于语言置信度提示法和同期方法。
To maintain user trust, large language models (LLMs) should signal low confidence on examples where they are incorrect, instead of misleading the user. The standard approach of estimating confidence is to use the softmax probabilities of these models, but as of November 2023, state-of-the-art LLMs such as GPT-4 and Claude-v1.3 do not provide access to these probabilities. We first study eliciting confidence linguistically -- asking an LLM for its confidence in its answer -- which performs reasonably (80.5% AUC on GPT-4 averaged across 12 question-answering datasets -- 7% above a random baseline) but leaves room for improvement. We then explore using a surrogate confidence model -- using a model where we do have probabilities to evaluate the original model's confidence in a given question. Surprisingly, even though these probabilities come from a different and often weaker model, this method leads to higher AUC than linguistic confidences on 9 out of 12 datasets. Our best method composing linguistic confidences and surrogate model probabilities gives state-of-the-art confidence estimates on all 12 datasets (84.6% average AUC on GPT-4).
研究动机与目标
- 解决在 GPT-4 和 Claude-v1.3 等前沿大语言模型中,因不暴露内部 softmax 概率而难以可靠估计置信度的挑战。
- 通过解决语言置信度提示法在粗粒度、重复输出方面的局限性,改进其在模型自我报告置信度方面的表现。
- 开发一种实用且低成本的方法,利用小型开源代理模型提供的可访问概率,估计黑箱大语言模型的置信度。
- 证明即使代理模型弱于目标模型或与之不同,其概率仍可有效迁移并提升置信度估计性能。
- 结合语言置信度与代理模型概率,在多种基准测试中实现选择性分类的最先进性能。
提出的方法
- 通过提示目标大语言模型(如 GPT-4)使用多种提示格式,自行评估其对答案的置信度,以提取语言置信度。
- 使用可访问内部 softmax 概率的代理模型(如 Llama 2、text-davinci-003)对相同输入生成置信度分数。
- 通过混合目标模型的语言置信度与代理模型的概率置信度,组合生成置信度估计。
- 对语言置信度与代理模型置信度进行加权组合,以增强正确与错误预测之间的分离能力。
- 以选择性分类 AUC 作为主要评估指标,在包括 MMLU、TruthfulQA 和 MedQA 在内的 12 个多样化问答数据集上进行评估。
- 在多个模型(GPT-4、Claude-v1.3、GPT-3.5、Llama 2、text-davinci-003)和提示变体(包括思维链和 few-shot 格式)上验证方法的鲁棒性。

实验结果
研究问题
- RQ1当内部概率不可用时,语言置信度提示能否可靠估计模型不确定性?
- RQ2来自较弱、开源的代理模型的置信度估计,在多大程度上能提升对 GPT-4 等更强黑箱大语言模型的置信度估计?
- RQ3为何即使代理模型显著更小或准确率更低,置信度仍能在模型间有效迁移?
- RQ4语言置信度与代理模型概率如何互补,以提升整体置信度估计性能?
- RQ5简单的语言与代理模型置信度混合方法能否优于更复杂、更昂贵的方法(如自一致性)?
主要发现
- 在 GPT-4 上使用语言置信度提示,12 个数据集上的平均 AUC 为 80.5%——比随机基线高 7%,但远低于可用内部概率的水平。
- 使用 Llama 2 的概率进行代理置信度估计,将 GPT-4 的平均 AUC 提升至 82.1%,优于仅使用语言置信度。
- 将语言置信度与代理模型概率结合,使 GPT-4 的平均 AUC 提升至 83.4%,表明两种信号具有显著互补性。
- 表现最佳的方法——混合语言置信度与代理模型置信度——在全部 12 个数据集上实现了 84.6% 的最先进平均 AUC。
- 即使使用更弱的代理模型(如 Llama 2-13B 或 text-davinci-003),其 AUC 也与 GPT-4 和 Claude-v1.3 上的语言置信度相当或更优,表明具有强大的迁移能力。
- 该方法优于同期工作(Xiong et al., 2023),后者采用自一致性方法,需对每个输入调用五次 GPT-4,计算成本更高。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。