[论文解读] Internet-Augmented Dialogue Generation
本文提出了一种互联网增强型对话生成框架,通过搜索查询动态检索最新知识,从而提升事实一致性并减少幻觉。通过从对话上下文生成搜索查询,检索结果,并使用Fusion-in-Decoder方法将检索到的证据融入解码器,该模型在新收集的众包数据集上,经由使用实时互联网搜索的真人'巫师'参与的对话中,其自动评估与人工评估结果均优于非增强模型和基于FAISS的检索模型。
The largest store of continually updating knowledge on our planet can be accessed via internet search. In this work we study giving access to this information to conversational agents. Large language models, even though they store an impressive amount of knowledge within their weights, are known to hallucinate facts when generating dialogue (Shuster et al., 2021); moreover, those facts are frozen in time at the point of model training. In contrast, we propose an approach that learns to generate an internet search query based on the context, and then conditions on the search results to finally generate a response, a method that can employ up-to-the-minute relevant information. We train and evaluate such models on a newly collected dataset of human-human conversations whereby one of the speakers is given access to internet search during knowledgedriven discussions in order to ground their responses. We find that search-query based access of the internet in conversation provides superior performance compared to existing approaches that either use no augmentation or FAISS-based retrieval (Lewis et al., 2020).
研究动机与目标
- 为解决大型语言模型中静态知识的局限性,这些模型在训练时即被冻结,容易产生事实性幻觉。
- 开发一种对话生成系统,可在对话过程中动态访问互联网上的最新信息。
- 评估互联网增强型生成方法相较于非增强模型和基于FAISS的检索模型的有效性。
- 收集并发布一个新的真人-真人对话数据集,其中一名参与者使用互联网搜索来支撑其回应,从而实现对实时知识整合的评估。
- 分析互联网增强设计中的不同选择的影响,包括查询生成和检索集成。
提出的方法
- 该模型采用序列到序列架构,从对话上下文生成搜索查询。
- 生成的查询用于通过外部搜索引擎(如Bing)检索相关网页文档。
- 检索到的文档随后通过Fusion-in-Decoder(FiD)方法进行编码并融合进解码器输入。
- 解码器在对话历史和检索到的外部知识双重条件下生成回应。
- 该模型在新收集的众包数据集上进行微调,其中一名说话人(即“巫师”)执行互联网搜索以获取信息来支持回应。
- 通过自动指标和人工评估对系统进行评估,与非增强模型和基于FAISS的检索基线进行对比。
实验结果
研究问题
- RQ1能否证明,能够生成搜索查询并检索实时网络结果的对话模型,其生成的回应在事实准确性上优于仅依赖训练时冻结知识的模型?
- RQ2在知识对齐的对话中,互联网增强型对话生成的性能与基于FAISS的检索模型及非增强模型相比如何?
- RQ3互联网增强型对话生成中的关键失败模式有哪些,例如查询生成错误或错误的知识选择?
- RQ4不同的设计选择(如查询构建方式或检索集成策略)如何影响模型生成准确且相关回应的能力?
- RQ5相较于标准语言模型,互联网增强在多大程度上提升了可解释性和可调试性?
主要发现
- 互联网增强模型在自动评估和人工评估中均显著优于非增强模型和基于FAISS的检索模型,展现出更优的事实一致性与回应相关性。
- 该模型能够检索并正确使用最新信息,例如近期电视剧剧情、餐厅详情和体育赛事比分,而静态模型无法获取此类信息。
- 尽管有所改进,该模型仍存在错误,包括错误使用知识、搜索查询生成失误,以及在有正确信息时未能正确利用的情况。
- 人工评估确认,互联网增强模型生成的回应在感知上更具信息量且更准确,优于非增强模型。
- 该模型能够生成人类可读的搜索查询并引用检索到的文档,相比标准语言模型,显著提升了可解释性和可调试性。
- 本研究发现,即使知识正确,模型仍可能默认生成通用回应,凸显了在检索之外实现知识有效利用的挑战。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。