[论文解读] Topical-Chat: Towards Knowledge-Grounded Open-Domain Conversations
本文介绍了Topical-Chat,一个基于人类对人类、知识增强的开放域对话数据集,涵盖8个广泛主题的约11,000段对话,无预设角色,采用对称或非对称的阅读材料集合以反映现实世界中的知识多样性。作者在该数据集上训练了基于Transformer的编码器-解码器模型,通过自动评估和人工评估验证了响应多样性与知识对齐性的提升,最佳模型在频繁测试集上达到0.84的unigram F1和0.83的bigram多样性。
Building socialbots that can have deep, engaging open-domain conversations with humans is one of the grand challenges of artificial intelligence (AI). To this end, bots need to be able to leverage world knowledge spanning several domains effectively when conversing with humans who have their own world knowledge. Existing knowledge-grounded conversation datasets are primarily stylized with explicit roles for conversation partners. These datasets also do not explore depth or breadth of topical coverage with transitions in conversations. We introduce Topical-Chat, a knowledge-grounded human-human conversation dataset where the underlying knowledge spans 8 broad topics and conversation partners don't have explicitly defined roles, to help further research in open-domain conversational AI. We also train several state-of-the-art encoder-decoder conversational models on Topical-Chat and perform automated and human evaluation for benchmarking.
研究动机与目标
- 为解决缺乏反映现实世界对话知识不对称性与话题深度差异的自然、知识增强的开放域对话数据集的问题。
- 通过提供广泛的话题覆盖和自然的话题过渡,推动开放域对话人工智能的研究。
- 在真实、人工生成的知识增强对话基准上对当前最先进模型进行基准测试。
- 通过自动评估与人工评估指标,评估知识对齐在响应生成中的有效性。
提出的方法
- 数据集通过Amazon Mechanical Turk收集,将参与者配对,其接收特定主题的阅读材料集合(维基百科、华盛顿邮报、Reddit),并开展自然、无角色限制的对话。
- 阅读材料集合被设计为对称或非对称,以反映对话双方之间现实世界中的知识不平衡。
- 每段对话均被标注阅读材料使用情况、情感及其他维度,以支持评估。
- 作者在Topical-Chat上微调基于Transformer的编码器-解码器模型,采用知识感知注意力机制,上下文窗口大小为$W_H = 32$。
- 模型在BookCorpus上进行或不进行预训练,使用束搜索(束大小为5)和字节对编码(BPE)进行词汇标记化。
- 通过将解码器同时基于对话历史和检索到的知识句子进行条件化,实现知识对齐,$W_K = 128$以支持长知识输入。
实验结果
研究问题
- RQ1基于Transformer的模型在开放域对话中,利用多样化、真实世界知识源生成响应的效率如何?
- RQ2知识对齐在多大程度上提升了开放域对话中响应的连贯性、话题相关性与参与度?
- RQ3不同的训练策略(如预训练与知识整合)如何影响模型性能?
- RQ4自动化指标在知识增强对话中与人工判断响应质量的相关性如何?
主要发现
- 表现最佳的模型(带知识与预训练的Transformer)在频繁测试集上达到0.22的unigram F1与0.84的bigram多样性,表明其具有高度的词汇信息量与多样性。
- 知识增强模型相比非知识基线模型表现出更高的unigram F1(0.22)与更高的困惑度(34.1),而非知识基线模型为F1: 0.16,PPL: 29.8,证实其与真实响应的对齐性更优。
- 人工评估显示,使用知识的模型在知识利用方面评分更高(平均0.80),而无知识模型评分较低(0.08),尽管整体效果仍属中等。
- 上下文窗口大小$W_H = 32$的模型在自动化指标上表现最佳,表明过大的上下文窗口会损害对关键对话标记的关注。
- 人工评估者对“有趣”与“继续对话”标签的一致性较低(kappa < 0.3),表明这些属性具有较强的主观性,但其他指标(可理解性、话题相关性)具有较高可靠性(kappa ≥ 0.67)。
- 该数据集支持自然的话题过渡与多样化知识使用,表现为高多样性得分,且标注显示阅读材料使用具有一致性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。