[论文解读] Alleviating Hallucinations of Large Language Models through Induced Hallucinations
本文提出了一种轻量级解码方法——先诱导再对比解码(Induce-then-Contrast Decoding, ICD),通过先在弱模型中诱导幻觉,再在解码过程中利用对比解码对幻觉进行惩罚,从而缓解大语言模型中的幻觉问题。ICD 显著提升了事实性,使 Llama2-7B-Chat 和 Mistral-7B-Instruct 在 TruthfulQA 上的表现分别达到 GPT-3.5 和 GPT-4 的水平。
Despite their impressive capabilities, large language models (LLMs) have been observed to generate responses that include inaccurate or fabricated information, a phenomenon commonly known as ``hallucination''. In this work, we propose a simple extit{Induce-then-Contrast} Decoding (ICD) strategy to alleviate hallucinations. We first construct a factually weak LLM by inducing hallucinations from the original LLMs. Then, we penalize these induced hallucinations during decoding to enhance the factuality of the generated content. Concretely, we determine the final next-token predictions by amplifying the predictions from the original model and downplaying the induced untruthful predictions via contrastive decoding. Experimental results on both discrimination-based and generation-based hallucination evaluation benchmarks, such as TruthfulQA and extsc{FActScore}, demonstrate that our proposed ICD methods can effectively enhance the factuality of LLMs across various model sizes and families. For example, when equipped with ICD, Llama2-7B-Chat and Mistral-7B-Instruct achieve performance comparable to ChatGPT and GPT4 on TruthfulQA, respectively.
研究动机与目标
- 为解决大语言模型中持续存在的幻觉问题,即尽管整体表现强劲,但仍会生成事实错误或虚构内容。
- 开发一种解码级方法,在不修改模型权重或进行大量微调的前提下提升事实性。
- 探究是否可在弱模型中诱导幻觉,作为识别并抑制原始模型中非事实性生成的代理方法。
- 在多种模型规模和架构上评估该方法,确保其广泛适用性和鲁棒性。
- 提供一种轻量、高效且有效的幻觉缓解方案,替代数据密集型或训练驱动的现有方法。
提出的方法
- 通过轻微微调或零 shot 提示,使原始大语言模型生成事实性较弱的模型。
- 使用对比解码方法增强原始模型的预测,同时降低由诱导幻觉模型生成的预测。
- 应用对比损失机制,通过比较原始模型与诱导幻觉模型的输出,调整标记的概率。
- 利用参数高效的微调(LoRA)在极低计算开销下训练诱导幻觉的弱模型。
- 通过结合原始模型输出与对诱导幻觉标记的对比惩罚,实现解码,以抑制非事实性生成。
- 采用两阶段推理流程:首先分别从两个模型生成,然后应用对比解码对最终输出进行优化。
实验结果
研究问题
- RQ1在弱模型中诱导幻觉是否可作为识别并抑制原始大语言模型中非事实性生成的有效代理?
- RQ2在事实性模型与诱导幻觉模型之间采用对比解码,是否能显著提升大语言模型输出的事实性?
- RQ3ICD 在不同模型架构和规模(包括 Llama2、Mistral 及其对话变体)上的表现如何?
- RQ4ICD 是否在事实精确度和响应质量方面优于直接使用事实数据进行微调的方法?
- RQ5ICD 对模型连贯性和响应长度有何影响?是否保留了通过 RLHF 学习到的原始帮助性?
主要发现
- ICD 将 Llama2-7B-Chat 在 TruthfulQA MC1 分数上提升了 +8 分,Mistral-7B-Instruct 提升了 +20 分,使其性能分别与 GPT-3.5 和 GPT-4 看齐。
- 在 FActScore 基准测试中,使用 ICD 增强的 Llama2-7B-Chat 达到了 66.3 的事实精确度得分,优于同模型的 70B 版本。
- 与使用维基百科传记直接微调相比,ICD 更有效地减少了幻觉,后者反而引入了新的幻觉并降低了响应质量。
- 该方法保持了高水平的响应质量和长度,避免了直接微调方法中常见的响应缩短和帮助性丧失问题。
- ICD 在多个模型家族和规模(包括 7B 和 70B 参数变体)上均表现出一致的性能提升。
- 由于需要两次前向传播,ICD 仅使推理延迟增加 1.6 倍,且得益于 LoRA 微调,GPU 显存开销可忽略不计。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。