Skip to main content
QUICK REVIEW

[论文解读] Dialogue Natural Language Inference

Sean Welleck, Jason Weston|arXiv (Cornell University)|Nov 1, 2018
Topic Modeling参考文献 16被引用 18
一句话总结

本文提出了一种自然语言蕴涵(NLI)框架,通过在新数据集Dialogue NLI上进行模型训练,以提升对话的一致性。该数据集包含标注为蕴涵、中性或矛盾的个性与话语配对。通过使用训练好的NLI模型对对话候选进行重排序,该方法显著减少了个性矛盾——在自动指标和人工评估中均得到验证——展示了NLI作为提升对话系统一致性的有效工具。

ABSTRACT

Consistency is a long standing issue faced by dialogue models. In this paper, we frame the consistency of dialogue agents as natural language inference (NLI) and create a new natural language inference dataset called Dialogue NLI. We propose a method which demonstrates that a model trained on Dialogue NLI can be used to improve the consistency of a dialogue model, and evaluate the method with human evaluation and with automatic metrics on a suite of evaluation sets designed to measure a dialogue model's consistency.

研究动机与目标

  • 为解决对话模型中持续存在的不一致性问题,特别是代理与其自身或先前话语相矛盾的个性矛盾问题。
  • 探究自然语言蕴涵(NLI)是否可作为评估和提升对话一致性的代理方法。
  • 创建一个专为基于个性的对话一致性而设计的新数据集Dialogue NLI。
  • 开发并评估一种实用方法,利用NLI对对话候选进行重排序,从而在不修改模型架构的情况下提升模型的一致性。

提出的方法

  • 作者构建了Dialogue NLI数据集,该数据集由来自个性档案和对话话语的句子对组成,并标注了蕴涵、中性或矛盾关系。
  • 他们在Dialogue NLI上训练标准NLI模型,以分类前提(例如,个性句子或先前话语)与假设(例如,候选回复)之间的关系。
  • 核心方法是利用NLI模型的置信度分数对对话轮次的候选回复进行重排序,优先选择蕴涵关系并避免矛盾关系。
  • 重排序过程采用温度缩放的加权组合方式,结合NLI得分与生成模型的logits,超参数在验证数据上进行调优。
  • 评估通过自动指标(Contradict@k,Entail@k)和基于ParlAI与Amazon Mechanical Turk的基于个性的对话设置下的人工评估进行。
  • 该方法应用于一个键值记忆网络模型,对比了使用和不使用NLI重排序时的性能表现。

实验结果

研究问题

  • RQ1自然语言蕴涵能否有效用于检测和减少对话系统中的个性矛盾?
  • RQ2在对话特定数据(Dialogue NLI)上训练NLI模型,如何提升响应生成的一致性?
  • RQ3与基线对话模型相比,基于NLI的重排序在多大程度上能减少不一致错误?
  • RQ4基于NLI预测的自动指标能否可靠地衡量个性一致性,从而减少对昂贵人工评估的依赖?
  • RQ5在交互式场景中,NLI重排序对人工评分的对话质量和一致性有何影响?

主要发现

  • NLI重排序方法显著降低了矛盾率,人类评估集上的Contradict@1从0.35降至0.27,表明不一致响应更少。
  • 该方法将Entail@1得分从0.25提升至0.35,表明更多与个性一致的响应被排在更高位置。
  • 在所有三个评估集(Haves, Likes, Attributes)中Hits@1均有所提升,证实重排序后整体响应质量更高。
  • 人工评估者对NLI重排序模型的细粒度一致性评分为0.27(基线为0.35),矛盾检测率降低25%(0.16 vs. 0.25),证实了一致性得到改善。
  • 自动指标Contradict@k和Entail@k在所有评估集中均表现出一致改进,验证了其作为人工评估代理的可靠性。
  • 结果表明,利用在对话特定数据上微调的预训练NLI模型,可有效提升一致性,且无需修改底层对话生成架构。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。