QUICK REVIEW
[论文解读] Why Do Neural Dialog Systems Generate Short and Meaningless Replies? A Comparison between Dialog and Translation
Bolin Wei, Shuai Lu|arXiv (Cornell University)|Dec 6, 2017
Topic Modeling参考文献 12被引用 10
一句话总结
本文通过在机器翻译任务中模拟对话式的模糊性(即数据洗牌),探究神经对话系统生成简短、通用回复的原因。作者通过人为为每个输入创建多个合理响应,重现了对话系统中观察到的退化行为,证明响应模糊性(而非模型架构)是序列到序列模型生成无信息输出的关键原因。
ABSTRACT
This paper addresses the question: Why do neural dialog systems generate short and meaningless replies? We conjecture that, in a dialog system, an utterance may have multiple equally plausible replies, causing the deficiency of neural networks in the dialog application. We propose a systematic way to mimic the dialog scenario in a machine translation system, and manage to reproduce the phenomenon of generating short and less meaningful sentences in the translation setting, showing evidence of our conjecture.
研究动机与目标
- 探究神经开放域对话系统生成简短、无意义回复的根本原因。
- 确定对话数据中输入与输出之间缺乏严格对齐是否导致模型退化。
- 测试在机器翻译任务中引入人为模糊性后,是否可复现对话系统中通用回复生成的现象。
- 评估在非对齐训练条件下,响应多样性与信息量是否下降。
提出的方法
- 作者通过打乱训练数据中源句与目标句对的顺序,在机器翻译任务中模拟对话式的模糊性。
- 在原始和打乱的翻译数据集上训练标准的序列到序列模型,以比较模型行为差异。
- 通过BLEU分数、响应长度、负对数似然和熵等指标评估模型输出,以衡量信息量与多样性。
- 分析解码过程中RNN隐藏状态与时间步的相关性,以评估模型对响应长度的预测能力。
- 系统性地改变打乱程度(25%、50%、75%、100%),观察其对模型行为的影响。
- 比较正常翻译、打乱翻译和真实对话设置下的模型输出,以隔离数据对齐性的影响。
实验结果
研究问题
- RQ1为何神经对话系统相比翻译系统更倾向于生成简短且无意义的回复?
- RQ2能否在机器翻译设置中复现对话系统中通用回复生成的现象?
- RQ3通过打乱训练样本引入人为模糊性,是否会导致翻译模型的响应质量与信息量下降?
- RQ4对话数据的非对齐特性如何影响序列生成中响应长度的可预测性?
- RQ5训练数据中模糊性程度的提高在多大程度上降低了生成响应的熵与信息量?
主要发现
- 在正常设置下,对话系统生成的回复比参考文本短20%,负对数似然和熵分别下降0.71和0.99。
- 当训练数据被打乱以模拟对话模糊性时,翻译模型的响应长度、BLEU分数和信息量指标随打乱程度增加而单调下降。
- 在100%打乱时,BLEU-1降至12.5,BLEU-4降至0.00,负对数似然骤降至0.024,表明输出高度通用且信息量极低。
- 在对话系统和打乱翻译设置中,RNN隐藏状态与时间步的相关性显著下降,表明模型对响应长度的预测能力变差。
- 即使在100%打乱时,编码器侧的相关性仍上升至99%,表明隐藏状态动态在编码器与解码器网络中可能受到不同影响。
- 结果提供了强有力的实证证据,表明响应模糊性(源于多个合理响应)是神经对话系统生成退化输出的关键因素。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。