Skip to main content
QUICK REVIEW

[论文解读] Towards Personalized Dialog Policies for Conversational Skill Discovery

Maryam Fazel-Zarandi, Sampat Biswas|arXiv (Cornell University)|Nov 15, 2019
Speech and dialogue systems参考文献 33被引用 4
一句话总结

本文提出一种基于强化学习(RL)的对话代理,用于语音助手中的个性化技能发现,通过适应用户属性(例如首次使用与返回用户)和对话风格(例如简洁与冗长)来改进基于规则的系统。在真实生产环境中的评估显示,RL代理的平均成功率为76.99%,对话轮数为4.65轮,显著优于基于规则的代理(成功率73.41%,对话轮数4.97轮),证明了其在个性化和效率方面的提升。

ABSTRACT

Many businesses and consumers are extending the capabilities of voice-based services such as Amazon Alexa, Google Home, Microsoft Cortana, and Apple Siri to create custom voice experiences (also known as skills). As the number of these experiences increases, a key problem is the discovery of skills that can be used to address a user's request. In this paper, we focus on conversational skill discovery and present a conversational agent which engages in a dialog with users to help them find the skills that fulfill their needs. To this end, we start with a rule-based agent and improve it by using reinforcement learning. In this way, we enable the agent to adapt to different user attributes and conversational styles as it interacts with users. We evaluate our approach in a real production setting by deploying the agent to interact with real users, and show the effectiveness of the conversational agent in helping users find the skills that serve their request.

研究动机与目标

  • 为解决大规模语音助手中技能发现的挑战,即用户在成千上万项技能中难以找到相关技能。
  • 通过基于用户属性和对话偏好的个性化交互,改进对话式技能发现。
  • 开发一种能够利用强化学习动态适应用户行为的对话策略,超越静态的基于规则的系统。
  • 在真实生产环境中评估基于RL的代理的有效性,使用真实用户进行测试。
  • 证明个性化、自适应的对话策略可带来更高的成功率和更短的对话轮数。

提出的方法

  • 以基于规则的对话代理作为语音助手中技能发现的基线模型。
  • 训练强化学习(RL)代理,通过用户反馈作为稀疏奖励,优化成功率和对话轮数。
  • 在RL环境中将用户属性(例如首次使用与返回用户)和对话风格(例如简洁与冗长)作为状态特征。
  • 定义状态空间,包含用户上下文、历史记录和偏好;动作空间涵盖推荐、信息询问和导航操作。
  • 使用深度Q网络(DQN)或类似RL算法,学习最大化对话轮数累积奖励的策略。
  • 将训练好的RL代理部署在真实生产环境中,与基于规则的基线模型进行性能对比。

实验结果

研究问题

  • RQ1基于强化学习的对话策略是否能在真实世界语音助手的技能发现中超越基于规则的策略?
  • RQ2基于用户属性(例如首次使用与返回用户)的个性化如何影响对话的成功率和效率?
  • RQ3适应对话风格(例如简洁与冗长)在多大程度上能提升用户满意度和任务完成度?
  • RQ4RL代理是否能够学习在保持或提高成功率的同时减少对话轮数?
  • RQ5是否能够有效训练并规模化部署一种与领域无关的个性化对话策略?

主要发现

  • 基于RL的代理实现了76.99%的成功率,显著高于基于规则代理的73.41%(p < 0.0001)。
  • RL代理将平均对话轮数减少至4.65轮,低于基于规则代理的4.97轮(p < 0.0001)。
  • 对于首次使用用户,RL策略的成功率为77.14%,优于基于规则策略的72.68%;对于返回用户,RL策略为76.76%,优于基于规则策略的74.49%;两项差异均具有统计显著性(p < 0.0001)。
  • 基于规则的策略在首次使用与返回用户之间表现出显著性能差距(p = 0.0010),表明其对返回用户存在偏见;而RL策略在两组用户间实现了更均衡的表现。
  • RL代理成功适应了用户属性和对话风格,证明了在真实环境中学习个性化策略的有效性。
  • 本研究证实,通过强化学习优化完整对话交互,可显著提升成功率和效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。