[论文解读] Talking to myself: self-dialogues as data for conversational agents
本文提出自对话(self-dialogues)——由单个众包工作者通过 Amazon Mechanical Turk 创造的虚构二人对话——作为一种低成本收集主题性、非结构化对话数据的有效方法。作者在 23 个主题上收集了 360 万词的语料库,通过定性分析表明,自对话产生的回复比标准二人对话或 OpenSubtitles 数据更具连贯性和吸引力,因此非常适用于训练开放域对话代理。
Conversational agents are gaining popularity with the increasing ubiquity of smart devices. However, training agents in a data driven manner is challenging due to a lack of suitable corpora. This paper presents a novel method for gathering topical, unstructured conversational data in an efficient way: self-dialogues through crowd-sourcing. Alongside this paper, we include a corpus of 3.6 million words across 23 topics. We argue the utility of the corpus by comparing self-dialogues with standard two-party conversations as well as data from other corpora.
研究动机与目标
- 解决当前缺乏大规模、主题性、非结构化对话语料库的问题,这些语料库适合用于训练开放域对话代理。
- 通过让单个众包工作者策划自对话,取代二人对话,从而降低数据收集成本和复杂性。
- 评估自对话在训练对话代理方面的质量与适用性,与现有语料库进行比较。
- 为研究和模型训练提供一个公开可用的、多样化且主题特定的对话语料库。
提出的方法
- 通过 Amazon Mechanical Turk 收集众包自对话,众包工作者在给定主题下模拟两名说话人。
- 每位对话包含 20 个文本框,模拟来回对话,仅施加最少约束以促进自然性。
- 使用基于词袋表示的余弦相似度和禁用词列表进行自动化过滤,以剔除低质量或不当内容的提交。
- 最终语料库包含 23 个主题的 360 万词,仅 0.6% 的对话被拒绝(23,000 多个中 145 个)。
- 在自对话语料库上训练一个简单的检索式对话机器人,并使用预设查询与 OpenSubtitles 进行对比评估。
- 通过定性分析比较两种语料库在通用和主题性查询下的回复相关性与参与度。
实验结果
研究问题
- RQ1由单个众包工作者生成的自对话能否产生与两人对话同样连贯且吸引人的对话数据?
- RQ2与 OpenSubtitles 等现有语料库相比,自对话方法在开放域对话代理的回复质量方面表现如何?
- RQ3自对话语料库在多大程度上支持训练针对特定主题的开放域对话代理?
- RQ4自对话方法是否在显著降低数据收集成本的同时保持了数据质量?
主要发现
- 与两人对话相比,自对话方法将数据收集成本降低了 50%,因为每条对话仅需支付一名工作者的费用。
- 自对话产生的回复比 OpenSubtitles 数据更具连贯性和吸引力,尤其在主题性查询中表现更优。
- 语料库包含 23 个主题的 360 万词,仅 0.6% 的提交因重复或语言质量差而被拒绝。
- 定性分析表明,自对话语料库生成的回复更具上下文相关性,更适用于开放域人机对话交互。
- 在自对话语料库上训练的检索式对话机器人,在通用和主题性查询的回复相关性和参与度方面,均优于在 OpenSubtitles 上训练的模型。
- 该语料库已公开发布于 github.com/jfainberg/self_dialogue_corpus,支持对话人工智能领域的未来研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。