[论文解读] Retrieve and Refine: Improved Sequence Generation Models For Dialogue
本文提出了一种名为RetrieveNRefine(RetNRef)的混合对话生成模型,该模型从候选响应集合中检索相关回复,并利用序列到序列模型对其进行精炼。通过将检索到的回复作为上下文与对话历史拼接,该模型生成的回复比独立的检索或生成模型更具吸引力且更符合上下文,其在ConvAI2数据集上的人工评估得分更优。
Sequence generation models for dialogue are known to have several problems: they tend to produce short, generic sentences that are uninformative and unengaging. Retrieval models on the other hand can surface interesting responses, but are restricted to the given retrieval set leading to erroneous replies that cannot be tuned to the specific context. In this work we develop a model that combines the two approaches to avoid both their deficiencies: first retrieve a response and then refine it -- the final sequence generator treating the retrieval as additional context. We show on the recent CONVAI2 challenge task our approach produces responses superior to both standard retrieval and generation models in human evaluations.
研究动机与目标
- 为解决纯序列生成模型在对话中生成的回复往往过短、过于通用且信息量不足的问题。
- 克服仅检索模型的僵化性,即当不存在完全匹配时无法根据特定对话上下文调整回复。
- 开发一种混合模型,结合检索的语义丰富性与生成的适应性,以实现更具吸引力、上下文感知的对话。
- 通过序列生成对检索到的候选回复进行精炼,同时在适当情况下保留其语义内容,以提升响应质量。
提出的方法
- 模型使用标准的两层LSTM与注意力机制作为生成器,其输入同时包含对话历史和检索到的回复。
- 使用键值记忆网络,基于对话历史与训练集中响应的余弦相似度,检索最相关的回复。
- 将检索到的回复前加上特殊分隔符标记,并与对话历史拼接,形成生成器的输入序列。
- 通过预先计算每个训练轮次的检索结果,并基于与真实标签的相似度对前100名候选进行重排序,以避免分布偏移问题。
- 引入两种变体:RetNRef+通过截断初始人格描述,强制模型关注检索到的回复;RetNRef++在词重叠超过60%时强制完全复制检索内容。
- 通过A/B测试进行人工评估,标注者需在模型生成的回复与人工回复或其他模型输出之间进行选择。
实验结果
研究问题
- RQ1将检索与生成相结合,是否能显著提升对话响应质量,优于单独使用任一方法?
- RQ2通过序列生成对检索到的回复进行精炼,是否能产生更具吸引力、更符合上下文且更丰富的回复?
- RQ3该模型在何时应完全复制检索回复、何时应修改它方面,决策效果如何?
- RQ4该模型能否避免‘我不知道’的问题,同时保持事实一致性与连贯性?
主要发现
- RetNRef++在与记忆网络检索模型的A/B人工评估中,以54.5%的显著胜率胜出,显示出在人类偏好上的优越性。
- 在与基线Seq2Seq生成器的A/B对比中,该模型赢得了54%的比较,证明其在互动性与连贯性方面表现更优。
- RetNRef++通过在词重叠超过60%时强制完全复制检索内容,有效减少了因逐词复制错误导致的错误,提升了可靠性。
- 人工标注者更偏好RetNRef++的回复,因其自然流畅、相关性强,并能恰当使用人格细节,如提及宠物、饮品及个人特质等检索句中的信息。
- 该模型成功平衡了检索与生成策略,在约50%的情况下选择直接复制检索回复,其余50%则根据质量与上下文进行精炼。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。