[论文解读] An Ensemble Model with Ranking for Social Dialogue
本文提出 Alana,一个用于 Amazon Alexa Prize 的集成社交对话系统,结合基于规则的模型与神经网络模型,并采用上下文感知的排序机制。通过在真实用户反馈(尽管存在噪声和稀疏性)上训练线性排序器,提升了响应选择性能,用户平均评分达到 3.28,略高于人工设计的排序器(3.26),提升虽小但具有统计显著性。
Open-domain social dialogue is one of the long-standing goals of Artificial Intelligence. This year, the Amazon Alexa Prize challenge was announced for the first time, where real customers get to rate systems developed by leading universities worldwide. The aim of the challenge is to converse "coherently and engagingly with humans on popular topics for 20 minutes". We describe our Alexa Prize system (called 'Alana') consisting of an ensemble of bots, combining rule-based and machine learning systems, and using a contextual ranking mechanism to choose a system response. The ranker was trained on real user feedback received during the competition, where we address the problem of how to train on the noisy and sparse feedback obtained during the competition.
研究动机与目标
- 解决构建开放域社交对话系统时,如何在长时间交互中保持吸引力与连贯性的问题。
- 克服基于回合的响应评估方法的局限性,后者往往偏好安全但缺乏吸引力的回复。
- 开发一种考虑整体对话结果而非仅单个回合的排序机制。
- 在真实部署过程中收集的噪声大、稀疏且延迟的用户反馈上,有效训练响应排序器。
- 通过在真实世界环境中持续学习真实用户评分,提升系统性能。
提出的方法
- 系统采用混合架构,集成基于规则的聊天机器人(如 Persona、Eliza、NewsBot)与数据驱动模型(检索式模型和生成式 Seq2Seq 模型)。
- 人工设计的排序函数结合了语义相似度、METEOR 分数、连贯性、情感极性以及主题差异等特征,对候选回复进行打分。
- 使用 VowpalWabbit 在 Alexa Prize 竞赛期间收集的真实用户反馈上训练线性分类器排序器,对话级评分标准为:4–5 分为正面,1–2 分为负面。
- 特征包括上下文与回复的 n-gram 词袋、位置相关的 n-gram、对话流度指标以及机器人名称嵌入。
- 在初始阶段于公开数据集(如 Cornell Movies 和 Twitter)上训练后,系统在真实对话中表现不佳,随后使用 60k 条真实对话数据对排序器进行再训练,显著提升了泛化能力。
- 最终系统通过训练好的排序器从集成模型中选择得分最高的回复,推理过程基于特征加权和。
实验结果
研究问题
- RQ1能否通过在真实、稀疏且带有噪声的用户反馈上训练响应排序模型,提升开放域社交对话系统的表现?
- RQ2基于真实用户评分的模型化排序器与人工设计的排序函数相比,在用户参与度和连贯性方面表现如何?
- RQ3当在线索引来自真实用户互动的反馈时,线性分类器模型在多大程度上能泛化到真实对话场景?
- RQ4与仅使用回合级特征相比,引入对话级反馈是否能带来更具吸引力且上下文更恰当的回复?
- RQ5尽管存在数据稀疏性和噪声,通过在真实用户数据上持续再训练,能否逐步提升对话系统的性能?
主要发现
- 在 Alexa Prize 竞赛中收集的真实用户反馈上训练的线性排序器,实现了 3.28 的平均用户评分,优于人工设计的排序器(3.26)。
- 尽管用户反馈具有噪声大、稀疏性强(评分按对话而非按回合给出)的特性,该模型仍成功学习到优先选择更具吸引力回复的模式。
- 在真实对话数据上对排序器进行再训练,显著提升了性能,相比在 Cornell Movies 和 Twitter 等公开数据集上初始训练的结果有明显改进。
- 最终系统处理了 272 场对话,平均评分为 3.28,证明了在生产环境中从真实用户反馈中学习的可行性。
- 在开发集上,模型对正负对话的分类准确率达到 69.40%,表明其能有效识别高质量互动。
- 作者报告称,后续使用 2017 年 8 月至 10 月间增加的反馈数据训练的神经排序器,在准确率上超过了线性模型,进一步证实了持续学习的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。