Skip to main content
QUICK REVIEW

[论文解读] Deploying Lifelong Open-Domain Dialogue Learning

Kurt Shuster, Jack Urbanek|arXiv (Cornell University)|Aug 18, 2020
Topic Modeling参考文献 35被引用 8
一句话总结

本文提出了一种终身开放域对话学习系统,语言模型通过在免费游玩的幻想角色扮演游戏环境中与内在动机驱动的人类玩家进行实时互动而持续改进。通过迭代式地收集人类-模型对话、微调模型并重新部署,该系统在参与度和自动评估指标上均取得显著提升,数据收集成本仅为众包的1/5,且获得更有效、更符合分布的数据。

ABSTRACT

Much of NLP research has focused on crowdsourced static datasets and the supervised learning paradigm of training once and then evaluating test performance. As argued in de Vries et al. (2020), crowdsourced data has the issues of lack of naturalness and relevance to real-world use cases, while the static dataset paradigm does not allow for a model to learn from its experiences of using language (Silver et al., 2013). In contrast, one might hope for machine learning systems that become more useful as they interact with people. In this work, we build and deploy a role-playing game, whereby human players converse with learning agents situated in an open-domain fantasy world. We show that by training models on the conversations they have with humans in the game the models progressively improve, as measured by automatic metrics and online engagement scores. This learning is shown to be more efficient than crowdsourced data when applied to conversations with real users, as well as being far cheaper to collect.

研究动机与目标

  • 为克服开放域对话研究中静态众包数据集的局限性,使模型能够从真实人类互动中持续学习。
  • 探究在实际部署系统中,终身学习是否能在模型质量与用户参与度方面超越传统监督预训练方法。
  • 通过利用玩家的内在动机而非金钱激励,降低数据收集成本,同时提升数据质量。
  • 评估使用在线参与度指标(如玩家留存率)作为现实效用代理指标的终身学习有效性。
  • 探索模型规模与参与度之间的权衡,特别是大模型在减少幻觉与增加重复性之间的权衡。

提出的方法

  • 部署了一个免费游玩的幻想角色扮演游戏,让人类玩家在开放域、情境化对话环境中与语言模型互动。
  • 实时收集人类-模型对话数据,将游戏作为具备内在玩家动机的数据收集机制。
  • 通过结合新生成的人类对话数据与原始的LIGHT MTurk数据集,迭代式地重新训练并重新部署模型。
  • 使用在线参与度指标(特别是玩家留存率)作为模型性能的实时评估信号。
  • 在LIGHT众包数据与游戏中生成的人类数据(WILD)的组合上训练检索式对话模型,并对训练目标进行消融研究。
  • 通过众包方式进行人工评估,比较不同模型变体,重点关注错误类型(如矛盾、离题、重复)及整体愉悦度。

实验结果

研究问题

  • RQ1通过在实际部署的游戏环境中与真实人类互动进行终身对话学习,是否能相比静态数据集训练实现可测量的模型性能提升?
  • RQ2与众包数据相比,由内在动机驱动的玩家收集的数据在成本与质量方面如何影响模型改进与用户参与度?
  • RQ3当大模型在真实用户互动数据上进行微调时,其事实一致性与错误减少程度如何提升?在参与度方面是否出现新的权衡?
  • RQ4使用先前迭代中模型生成的回复作为训练目标(蒸馏)是否能实现与使用人工标注回复相当或更好的性能?
  • RQ5在实际部署环境中,不同模型架构与解码策略如何影响事实一致性、多样性与玩家愉悦度之间的平衡?

主要发现

  • 与传统众包相比,该系统的数据收集成本仅为1/5,且数据收集由玩家的内在动机驱动,而非金钱激励。
  • 在仅使用模型生成回复进行训练的基础上,微调人类生成游戏数据的模型在WILD验证集上的Hits@1/20指标相对提升了12.5%。
  • 相比较小模型(LW90M),大模型(LW622M)将矛盾错误减少了24%,离题回复减少了30%,表明事实一致性更优。
  • 尽管事实准确性提升,但大模型被评价为重复或无趣的频率是小模型的2.2倍,表明质量与参与度之间存在权衡。
  • 随着模型性能的提升,玩家留存率同步上升,表明更好的对话质量可提升实际系统中的用户留存率。
  • 从真实玩家互动中生成的WILD数据集,相比模型生成的回复,在微调时表现更优,其在WILD验证集上的Hits@1/20得分高出12.5%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。