[论文解读] A Corpus of Controlled Opinionated and Knowledgeable Movie Discussions for Training Neural Conversation Models
本文提出了 KOMODIS,一个新型对话数据集,其中包含对每位参与者明确控制的知识与观点配置的电影讨论。基于该数据集训练的自注意力解码器模型,能够生成自然、一致且具有观点倾向的回复,准确反映事实性知识与稳定个人立场,在知识性与个性一致性方面优于随机干扰基线模型。
Fully data driven Chatbots for non-goal oriented dialogues are known to suffer from inconsistent behaviour across their turns, stemming from a general difficulty in controlling parameters like their assumed background personality and knowledge of facts. One reason for this is the relative lack of labeled data from which personality consistency and fact usage could be learned together with dialogue behaviour. To address this, we introduce a new labeled dialogue dataset in the domain of movie discussions, where every dialogue is based on pre-specified facts and opinions. We thoroughly validate the collected dialogue for adherence of the participants to their given fact and opinion profile, and find that the general quality in this respect is high. This process also gives us an additional layer of annotation that is potentially useful for training models. We introduce as a baseline an end-to-end trained self-attention decoder model trained on this data and show that it is able to generate opinionated responses that are judged to be natural and knowledgeable and show attentiveness.
研究动机与目标
- 为解决端到端神经对话模型在非目标导向对话中知识保留与观点稳定性方面的不一致性问题。
- 构建一个大规模、高质量的对话数据集,其中每位参与者的知识与观点均被明确控制并标注。
- 实现神经模型在对话轮次中对事实性知识与个人观点保持全局一致性的训练。
- 验证众包工作者在对话创建过程中是否严格遵守其分配的知识与观点配置。
- 证明基于该数据集训练的模型能够生成人类评估者认为自然、知识丰富且个性一致的回复。
提出的方法
- 数据集通过 Amazon Mechanical Turk 收集,每对对话均被分配唯一、预定义的知识事实与关于电影及演员的观点配置。
- 知识事实从 IMDb 提取,包括角色关系或导演引语等趣味信息。
- 观点配置被设计为包含对实体的立场(例如:'喜爱导演'、'讨厌主角演员'),每个实体可包含多个观点。
- 每段对话均经人工评分者验证是否符合知识与观点配置,确保高度一致性。
- 在数据集上训练了一个基线端到端自注意力解码器模型,采用两种负采样策略:随机采样与规则基采样。
- 通过人工标注(自然性、一致性、个性与知识性)与自动指标(困惑度、hits@n)对模型进行评估。
实验结果
研究问题
- RQ1是否可以训练神经对话模型,在非目标导向对话中生成回复时长期保持一致的观点?
- RQ2模型在多大程度上能够从基于配置的受控数据集中学习并保留事实性知识?
- RQ3显式标注观点与知识是否能提升对话生成中模型的一致性与感知自然性?
- RQ4基于规则的负采样与随机负采样策略在知识与观点一致性方面对模型性能有何影响?
- RQ5在该受控设置下,自动指标如 hits@n 是否与人类对模型质量的判断具有相关性?
主要发现
- 人工评估显示在个性一致性方面达成高度一致(5分制得4.55分),证实众包工作者严格遵守了其分配的观点配置。
- 采用规则基负采样的模型在个性与知识性方面表现显著更优(hits@1: 79.33),优于随机负采样模型(hits@1: 74.22)。
- 尽管困惑度更高,规则基模型在人工评估中仍优于随机模型,表明自动指标如困惑度并不总与人类感知一致。
- hits@n 指标与人工评估结果表现出强相关性,表明其在此情境下是模型质量的可靠代理指标。
- 模型成功生成了自然、具有观点倾向且具备知识感知的回复,但在电影领域外的话题转移方面表现不佳。
- 结果证实,显式标注知识与观点可实现更一致且更具吸引力的神经对话系统训练。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。