[论文解读] Assessing the Reliability of Large Language Model Knowledge
本文提出 MONITOR,一种新颖的度量方法,通过测量在不同提示和上下文下输出概率分布的一致性,评估大语言模型(LLMs)的事实可靠性。该方法与准确率呈现强相关性(皮尔逊相关系数为 0.846),同时将计算成本降低 2.97 倍,并发布了公开的 FKTC 数据集,用于事实知识评估。
Large language models (LLMs) have been treated as knowledge bases due to their strong performance in knowledge probing tasks. LLMs are typically evaluated using accuracy, yet this metric does not capture the vulnerability of LLMs to hallucination-inducing factors like prompt and context variability. How do we evaluate the capabilities of LLMs to consistently produce factually correct answers? In this paper, we propose MOdel kNowledge relIabiliTy scORe (MONITOR), a novel metric designed to directly measure LLMs' factual reliability. MONITOR computes the distance between the probability distributions of a valid output and its counterparts produced by the same LLM probing the same fact using different styles of prompts and contexts.Experiments on a comprehensive range of 12 LLMs demonstrate the effectiveness of MONITOR in evaluating the factual reliability of LLMs while maintaining a low computational overhead. In addition, we release the FKTC (Factual Knowledge Test Corpus) test set, containing 210,158 prompts in total to foster research along this line (https://github.com/Vicky-Wil/MONITOR).
研究动机与目标
- 为解决在不同提示和上下文条件下大语言模型准确率度量的不稳定性问题,此类度量无法捕捉幻觉漏洞。
- 开发一种高分辨率度量方法,通过分析输出概率分布来捕捉大语言模型事实知识中的不确定性。
- 评估提示框架与上下文干扰对不同大语言模型可靠性影响的综合效应。
- 在保持高可靠性评估保真度的同时,降低事实知识评估的计算开销。
- 发布 FKTC 数据集(包含 210,158 个提示),以支持大语言模型事实可靠性研究的可复现性。
提出的方法
- MONITOR 计算使用不同提示风格和上下文输入探测同一事实时,输出概率分布之间的距离。
- 采用 Jensen-Shannon 散度(JSD)量化概率分布的偏差,作为事实可靠性的代理指标。
- 该方法在三个任务上评估大语言模型:问答(QA)、词预测(WP)和事实核查(FC)。
- 通过使用积分梯度法将模型输出归因于输入特征,分析上下文干扰的影响。
- MONITOR 的计算仅需完整准确率评估所需 GPU 小时数的三分之一,实现可扩展的评估。
- 该框架在 12 种不同规模和指令微调状态的大语言模型上进行了验证,包括 LLaMA-30b-ins 和 BLOOMZ 系列。
实验结果
研究问题
- RQ1在多样化提示条件下,MONITOR 与标准准确率度量的相关性如何?
- RQ2与基于完整准确率的可靠性评估相比,MONITOR 在计算成本上降低了多少?
- RQ3提示框架与上下文干扰如何影响大语言模型事实输出的一致性?
- RQ4更大的大语言模型是否在 MONITOR 度量下表现出更高的事实可靠性,符合规模定律?
- RQ5MONITOR 在不同提示配置下是否具有鲁棒性,表明其对多样化提示风格的泛化能力?
主要发现
- MONITOR 与 12 个大语言模型的平均准确率之间呈现强皮尔逊相关性(0.846),表明其与标准评估高度一致。
- 使用 MONITOR 相比完整准确率评估,GPU 小时数减少 2.97 倍,实现了显著的计算节省。
- MONITOR 值较低的模型(如 OPT-2b7 的 0.471)在集成梯度归因分析中表现出对上下文干扰的更低敏感性。
- BLOOMZ 和 Vicuna 模型在 MONITOR 分数上符合规模定律,更大的模型在 20 个测试数据集上均表现出更低的 MONITOR 值(更高的可靠性)。
- MONITOR 结果在不同提示分组中保持一致,7 个提示子集与 4 个提示子集的 MONITOR 分数之间呈现强线性相关性(r ≈ 0.95)。
- 公开发布了包含 210,158 个提示的 FKTC 数据集,以支持大语言模型事实可靠性评估的可复现性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。