[论文解读] RHO ($ρ$): Reducing Hallucination in Open-domain Dialogues with Knowledge Grounding
RHO ($ ho$) 是一种基于知识的对话系统,通过整合知识图谱(KGs)中的局部和全局知识接地,以及基于知识图谱子图遍历的响应重排序机制,有效减少了开放域对话中的幻觉现象。该方法显著降低了幻觉发生率——在 FeQA 上提升 17.54%,在人工评估中幻觉减少 32.93%——同时保持了优异的响应质量,并充分覆盖了知识图谱中的实体与关系。
Dialogue systems can leverage large pre-trained language models and knowledge to generate fluent and informative responses. However, these models are still prone to produce hallucinated responses not supported by the input source, which greatly hinders their application. The heterogeneity between external knowledge and dialogue context challenges representation learning and source integration, and further contributes to unfaithfulness. To handle this challenge and generate more faithful responses, this paper presents RHO ($ρ$) utilizing the representations of linked entities and relation predicates from a knowledge graph (KG). We propose (1) local knowledge grounding to combine textual embeddings with the corresponding KG embeddings; and (2) global knowledge grounding to equip RHO with multi-hop reasoning abilities via the attention mechanism. In addition, we devise a response re-ranking technique based on walks over KG sub-graphs for better conversational reasoning. Experimental results on OpenDialKG show that our approach significantly outperforms state-of-the-art methods on both automatic and human evaluation by a large margin, especially in hallucination reduction (17.54% in FeQA).
研究动机与目标
- 为解决知识接地对话系统中持续存在的幻觉问题,即响应与对话历史或外部知识相矛盾或无法验证。
- 缓解非结构化对话文本与结构化知识图谱(KG)数据之间的表征与融合鸿沟。
- 在不牺牲对话质量或流畅性的情况下,提升响应生成的忠实度。
- 开发一种通过结构化知识整合与感知推理的重排序机制,同时提升内在与外在忠实度的方法。
- 通过将响应基于可验证的知识子图进行接地,提供更具可解释性与可靠性的对话系统。
提出的方法
- 局部知识接地将知识图谱中的实体与关系嵌入,直接与对话上下文中的文本提及进行融合。
- 全局知识接地通过记忆库中子图三元组的注意力机制,实现多跳推理与动态知识整合。
- 响应重排序模块利用知识图谱子图上的遍历路径,评估并优先选择与知识路径对齐度更高的响应。
- 该模型在编码器-解码器框架中结合局部与全局接地,增强对话与知识模态之间的表征一致性。
- 知识图谱嵌入预先训练,并通过提及检测与链接模块与对话中的提及进行关联。
- 该框架在 OpenDialKG 数据集上进行端到端微调,并通过自动评估与人工评估共同衡量忠实度。
实验结果
研究问题
- RQ1如何通过基于结构化知识的接地机制,减少知识接地对话系统中的内在幻觉?
- RQ2基于子图三元组的注意力机制进行全局知识接地,在多跳推理与响应忠实度方面能提升到何种程度?
- RQ3基于知识图谱子图遍历的重排序机制是否能有效通过强制知识一致性,减少外在幻觉?
- RQ4与仅使用单一机制相比,局部与全局接地的协同作用如何影响忠实度?
- RQ5忠实度指标与 BLEU 或 ROUGE 等传统自动指标之间存在何种权衡?
主要发现
- 与 OpenDialKG 数据集上的最先进基线相比,RHO 在 FeQA 忠实度指标上实现了 17.54% 的提升。
- 人工评估显示幻觉频率降低了 32.93%,响应与知识源的忠实度显著提高。
- 同时采用局部与全局知识接地(LKG+GKG)的模型,在 FeQA、QuestEval 与实体覆盖率方面均优于仅使用单一机制的模型。
- 基于知识图谱子图遍历的响应重排序进一步提升了忠实度,且未降低流畅性或覆盖率。
- 该模型展现出更广泛的实体与关系覆盖范围,表明其对知识的利用能力更强。
- 错误分析显示,外在幻觉仍是最常见的失败模式,提示在训练数据质量与事实核查机制的整合方面仍有改进空间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。