[论文解读] Retrieval Augmentation Reduces Hallucination in Conversation
本文提出了一种用于知识增强对话的检索增强生成(RAG)架构,以减少大语言模型中的幻觉现象。通过将神经检索与序列到序列模型结合使用检索器、排序器和迭代解码机制,作者在Wizard of Wikipedia和CMU_DoG数据集上实现了最先进性能,人类评估显示幻觉现象减少了60%以上,尤其在分布外话题上表现显著。
Despite showing increasingly human-like conversational abilities, state-of-the-art dialogue models often suffer from factual incorrectness and hallucination of knowledge (Roller et al., 2020). In this work we explore the use of neural-retrieval-in-the-loop architectures - recently shown to be effective in open-domain QA (Lewis et al., 2020b; Izacard and Grave, 2020) - for knowledge-grounded dialogue, a task that is arguably more challenging as it requires querying based on complex multi-turn dialogue context and generating conversationally coherent responses. We study various types of architectures with multiple components - retrievers, rankers, and encoder-decoders - with the goal of maximizing knowledgeability while retaining conversational ability. We demonstrate that our best models obtain state-of-the-art performance on two knowledge-grounded conversational tasks. The models exhibit open-domain conversational capabilities, generalize effectively to scenarios not within the training data, and, as verified by human evaluations, substantially reduce the well-known problem of knowledge hallucination in state-of-the-art chatbots.
研究动机与目标
- 解决当前最先进的对话模型中持续存在的事实性幻觉问题,即生成看似合理但错误的回复。
- 通过整合检索机制将响应基于外部知识源,从而改进知识增强对话系统。
- 在提升事实准确性的同时保持高对话流畅度,尤其在分布外和未见话题上表现更优。
- 评估不同检索增强架构及其组件(检索器、排序器、编码器-解码器)在减少幻觉方面的有效性。
提出的方法
- 采用检索增强生成(RAG)框架,其中神经检索器根据对话上下文从大规模语料库(如维基百科)中检索相关文档。
- 使用Poly-encoder Transformer实现对话历史与候选文档之间的细粒度、上下文感知的打分。
- 实施迭代检索机制,通过多轮检索与生成过程逐步优化检索到的文档。
- 将端到端训练的检索器与解码器中的融合(FiD)技术结合,实现在解码过程中对多个检索文档进行联合注意力计算。
- 设计一种基于轮次的检索机制,逐轮显式建模对话历史,相比标准检索方法显著提升了上下文保留能力。
- 使用序列到序列模型(如BART)端到端训练完整流水线,条件输入为对话历史与检索到的文档。
实验结果
研究问题
- RQ1与标准语言模型相比,检索增强生成是否能减少开放域、知识增强对话系统中的幻觉?
- RQ2不同架构组件(检索器、排序器、解码器架构)如何影响事实一致性和对话质量?
- RQ3检索增强是否能提升对训练期间未见的分布外话题的泛化能力?
- RQ4为平衡事实准确性、流畅度与计算成本,最优的检索文档数量是多少?
- RQ5与标准检索相比,迭代检索与基于轮次的文档检索在处理复杂多轮对话上下文时表现如何?
主要发现
- 所提出的基于RAG的模型相比基线语言模型,幻觉现象减少了60%以上,该结果经人类评估确认。
- 在分布外测试数据上,知识能力得分相比基线提升85%,显著优于标准模型。
- 在分布内数据上,知识F1分数提升70%;在分布外数据上,提升85%,展现出强大的泛化能力。
- 使用25篇检索文档在性能与计算成本之间达到最佳平衡,因为更多文档在某些架构中反而会增加幻觉。
- RAG-Sequence模型(逐个处理文档)在文档数量增加时仍能保持较高的F1与BLEU分数,而RAG-Token与FiD-RAG在大规模下因幻觉问题导致性能下降。
- 基于轮次的检索机制相比标准检索显著提升了上下文建模能力并减少了幻觉,后者常忽略对话历史。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。