[论文解读] A Token-level Reference-free Hallucination Detection Benchmark for Free-form Text Generation
本文提出了 HaDes,一个用于自由文本生成的无参考、基于词元的幻觉检测基准,采用经过扰动的维基百科文本和众包标注。该研究提出了一项新颖的任务,可在不依赖参考文本的情况下检测细粒度幻觉,通过迭代式模型在环标注实现生成过程中的实时检测,并在约11,000个实例上建立了全面的基线模型。
Large pretrained generative models like GPT-3 often suffer from hallucinating non-existent or incorrect content, which undermines their potential merits in real applications. Existing work usually attempts to detect these hallucinations based on a corresponding oracle reference at a sentence or document level. However ground-truth references may not be readily available for many free-form text generation applications, and sentence- or document-level detection may fail to provide the fine-grained signals that would prevent fallacious content in real time. As a first step to addressing these issues, we propose a novel token-level, reference-free hallucination detection task and an associated annotated dataset named HaDes (HAllucination DEtection dataSet). To create this dataset, we first perturb a large number of text segments extracted from English language Wikipedia, and then verify these with crowd-sourced annotations. To mitigate label imbalance during annotation, we utilize an iterative model-in-loop strategy. We conduct comprehensive data analyses and create multiple baseline models.
研究动机与目标
- 为解决自由文本生成中缺乏无参考、细粒度幻觉检测的问题,因为真实参考文本通常不可用。
- 通过仅利用前序上下文识别幻觉词元,实现在在线生成过程中实时检测幻觉。
- 尽管众包标注存在标签不平衡,仍创建一个平衡且高质量的词元级幻觉检测数据集。
- 通过基于特征的模型和预训练模型建立初步基线,以支持未来实时幻觉缓解系统的发展。
- 提供一个基准,支持NLG系统中的离线事后分析与在线实时干预。
提出的方法
- 从英文维基百科中抽取段落并进行扰动,以模拟幻觉内容,生成真实感强的训练样本。
- 采用迭代式模型在环策略指导众包标注,提升标注质量,并缓解幻觉检测中的标签不平衡问题。
- 将任务定义为词元级别的二分类:将每个词元片段分类为“幻觉”或“非幻觉”。
- 设计两种设置:离线(双向上下文)和在线(单向前序上下文),以模拟现实世界中的生成场景。
- 使用人类标注者从维基百科中收集并标注约11,000个实例,结合模型提供的建议以提高一致性。
- 在 HaDes 数据集上训练并评估多种基线模型,包括基于特征的模型和微调后的预训练模型。
实验结果
研究问题
- RQ1能否为自由文本生成有效构建无参考、基于词元的幻觉检测任务并完成标注?
- RQ2在数据集构建过程中,如何缓解众包幻觉标注中的标签不平衡问题?
- RQ3自由文本生成中幻觉词元的关键语言和事实特征是什么?
- RQ4不同模型架构在所提出的词元级幻觉检测基准上的表现如何?
- RQ5无参考检测模型在在线生成过程中实时检测幻觉的能力达到何种程度?
主要发现
- HaDes 数据集包含约11,000个标注实例,涵盖从维基百科中通过基于扰动的数据收集策略提取的幻觉与非幻觉词元片段。
- 迭代式模型在环标注方法显著提升了标注质量,并缓解了数据集中标签不平衡的问题。
- 基线模型(包括基于特征的模型和微调后的预训练模型)在词元级幻觉检测任务上取得了可测量的性能,确立了初步基准。
- 数据集显示,自由文本中的幻觉通常细微且局部化,通常表现为事实不一致或词元层面的不合理陈述。
- 基准的离线与在线设置表明,当具备双向上下文时,上下文感知模型能更准确地检测幻觉。
- 结果表明,词元级检测在实时干预NLG系统中具有可行性与价值,尤其在缺乏参考文本的情况下。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。