QUICK REVIEW
[论文解读] Dialogue Natural Language Inference
Sean Welleck, Jason Weston|arXiv (Cornell University)|Nov 1, 2018
Topic Modeling参考文献 16被引用 18
一句话总结
本文提出了一种自然语言蕴涵(NLI)框架,通过在新数据集Dialogue NLI上进行模型训练,以提升对话的一致性。该数据集包含标注为蕴涵、中性或矛盾的个性与话语配对。通过使用训练好的NLI模型对对话候选进行重排序,该方法显著减少了个性矛盾——在自动指标和人工评估中均得到验证——展示了NLI作为提升对话系统一致性的有效工具。
ABSTRACT
Consistency is a long standing issue faced by dialogue models. In this paper, we frame the consistency of dialogue agents as natural language inference (NLI) and create a new natural language inference dataset called Dialogue NLI. We propose a method which demonstrates that a model trained on Dialogue NLI can be used to improve the consistency of a dialogue model, and evaluate the method with human evaluation and with automatic metrics on a suite of evaluation sets designed to measure a dialogue model's consistency.
研究动机与目标
- 为解决对话模型中持续存在的不一致性问题,特别是代理与其自身或先前话语相矛盾的个性矛盾问题。
- 探究自然语言蕴涵(NLI)是否可作为评估和提升对话一致性的代理方法。
- 创建一个专为基于个性的对话一致性而设计的新数据集Dialogue NLI。
- 开发并评估一种实用方法,利用NLI对对话候选进行重排序,从而在不修改模型架构的情况下提升模型的一致性。
提出的方法
- 作者构建了Dialogue NLI数据集,该数据集由来自个性档案和对话话语的句子对组成,并标注了蕴涵、中性或矛盾关系。
- 他们在Dialogue NLI上训练标准NLI模型,以分类前提(例如,个性句子或先前话语)与假设(例如,候选回复)之间的关系。
- 核心方法是利用NLI模型的置信度分数对对话轮次的候选回复进行重排序,优先选择蕴涵关系并避免矛盾关系。
- 重排序过程采用温度缩放的加权组合方式,结合NLI得分与生成模型的logits,超参数在验证数据上进行调优。
- 评估通过自动指标(Contradict@k,Entail@k)和基于ParlAI与Amazon Mechanical Turk的基于个性的对话设置下的人工评估进行。
- 该方法应用于一个键值记忆网络模型,对比了使用和不使用NLI重排序时的性能表现。
实验结果
研究问题
- RQ1自然语言蕴涵能否有效用于检测和减少对话系统中的个性矛盾?
- RQ2在对话特定数据(Dialogue NLI)上训练NLI模型,如何提升响应生成的一致性?
- RQ3与基线对话模型相比,基于NLI的重排序在多大程度上能减少不一致错误?
- RQ4基于NLI预测的自动指标能否可靠地衡量个性一致性,从而减少对昂贵人工评估的依赖?
- RQ5在交互式场景中,NLI重排序对人工评分的对话质量和一致性有何影响?
主要发现
- NLI重排序方法显著降低了矛盾率,人类评估集上的Contradict@1从0.35降至0.27,表明不一致响应更少。
- 该方法将Entail@1得分从0.25提升至0.35,表明更多与个性一致的响应被排在更高位置。
- 在所有三个评估集(Haves, Likes, Attributes)中Hits@1均有所提升,证实重排序后整体响应质量更高。
- 人工评估者对NLI重排序模型的细粒度一致性评分为0.27(基线为0.35),矛盾检测率降低25%(0.16 vs. 0.25),证实了一致性得到改善。
- 自动指标Contradict@k和Entail@k在所有评估集中均表现出一致改进,验证了其作为人工评估代理的可靠性。
- 结果表明,利用在对话特定数据上微调的预训练NLI模型,可有效提升一致性,且无需修改底层对话生成架构。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。