[论文解读] Estimating the Hallucination Rate of Generative AI
本文提出后验幻觉率(PHR),一种基于贝叶斯方法,用于估计在上下文学习(ICL)设置下生成式AI模型产生幻觉输出的概率。通过从模型的预测分布中采样并评估响应的对数概率,PHR在无需外部分类器或任务特定调整的情况下,提供了准确且基于不确定性的幻觉风险估计,已在Llama-2模型上通过合成任务和自然语言任务得到验证。
This paper presents a method for estimating the hallucination rate for in-context learning (ICL) with generative AI. In ICL, a conditional generative model (CGM) is prompted with a dataset and a prediction question and asked to generate a response. One interpretation of ICL assumes that the CGM computes the posterior predictive of an unknown Bayesian model, which implicitly defines a joint distribution over observable datasets and latent mechanisms. This joint distribution factorizes into two components: the model prior over mechanisms and the model likelihood of datasets given a mechanism. With this perspective, we define a hallucination as a generated response to the prediction question with low model likelihood given the mechanism. We develop a new method that takes an ICL problem and estimates the probability that a CGM will generate a hallucination. Our method only requires generating prediction questions and responses from the CGM and evaluating its response log probability. We empirically evaluate our method using large language models for synthetic regression and natural language ICL tasks.
研究动机与目标
- 开发一种用于在条件生成模型(CGM)的上下文学习(ICL)中估计幻觉率的方法。
- 将幻觉定义为在真实潜在参数下概率较低的预测,基于ICL的贝叶斯解释。
- 创建一种计算高效的估计器,仅需模型生成和对数概率评估。
- 使用Llama-2模型在合成回归任务和自然语言ICL基准上验证该方法。
- 证明PHR估计器与实际误差率高度相关,并能捕捉认知不确定性。
提出的方法
- 将ICL形式化为贝叶斯推断,其中CGM从未知潜在模型的后验预测分布中采样。
- 将后验幻觉率(PHR)定义为:生成预测在真实潜在参数下具有低似然性的概率。
- 开发一种有限样本估计器,通过蒙特卡洛采样上下文补全并评估生成响应的对数概率。
- 利用CGM的预测分布估计PHR,而无需访问真实模型或外部分类器。
- 使用合成数据和自然语言任务验证估计器,将PHR与实际误差率和互信息进行比较。
- 证明PHR与互信息显著相关,表明其能捕捉认知不确定性。
实验结果
研究问题
- RQ1能否使用将模型视为执行后验预测推断的贝叶斯框架来估计上下文学习中的幻觉率?
- RQ2在合成回归任务中,所提出的PHR估计器在多大程度上能准确预测真实幻觉率?
- RQ3在使用Llama-2模型的自然语言ICL任务中,PHR估计器是否与实际误差率显著相关?
- RQ4PHR估计器对上下文长度、少样本示例数量和模型大小的变化是否具有鲁棒性?
- RQ5PHR与互信息等其他不确定性度量相比,在捕捉认知不确定性方面表现如何?
主要发现
- 在SST-2基准上,使用20次蒙特卡洛采样和100次y-采样时,PHR估计器的决定系数R²达到0.711,表明其与实际误差率高度相关。
- 在合成回归任务中,PHR估计器准确预测了真实幻觉率,且随着上下文规模增大,误差显著降低。
- 与互信息相比,PHR与真实幻觉率的关系更趋线性,表明其作为认知不确定性度量更具可靠性。
- 在所有评估任务中,互信息与实际误差率和PHR均显著相关,支持PHR作为不确定性的代理度量。
- 增加蒙特卡洛采样和y-采样数量可提高PHR估计器的准确性,而仅增加生成样本数量或模型大小则会降低性能。
- PHR估计器表现出良好的校准性,在AG News、Medical QP、RTE和WNLI等多个数据集上均表现出低平均绝对误差(MAE)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。