Skip to main content
QUICK REVIEW

[论文解读] Beyond Turing: Intelligent Agents Centered on the User

Maxine Eskénazi, Shikib Mehri|arXiv (Cornell University)|Jan 20, 2019
Speech and dialogue systems参考文献 36被引用 10
一句话总结

本文提出一种以用户为中心的智能代理范式,将关注点从代理性能转向用户影响。它引入用户反馈驱动评估(NUF),基于用户后续反应评估系统响应,证明仅从用户话语预测用户满意度的模型准确率达65.8%,平均绝对误差(MAE)为0.67,表明用户反馈是衡量系统质量最可靠的指标。

ABSTRACT

Most research on intelligent agents centers on the agent and not on the user. We look at the origins of agent-centric research for slot-filling, gaming and chatbot agents. We then argue that it is important to concentrate more on the user. After reviewing relevant literature, some approaches for creating and assessing user-centric systems are proposed.

研究动机与目标

  • 解决对话研究中过度侧重代理能力而忽视用户体验的失衡问题。
  • 挑战长期以来将类人欺骗(如图灵测试)作为成功基准的焦点。
  • 开发优先考虑用户满意度和实时反馈而非传统指标的评估方法。
  • 证明系统响应后的用户反馈是评估系统质量最可靠的信号。
  • 提供一种设计代理的框架,使其作为用户伙伴而非仅功能工具或对话模仿者。

提出的方法

  • 提出一种用户反馈驱动的评估框架,其中系统响应质量由用户的下一句话语判断。
  • 定义一个三分类质量尺度(S_sys < S_usr, S_sys = S_usr, S_sys > S_usr),将系统响应质量与用户反应进行比较。
  • 使用DSTC-1数据集的一个子集,包含1250个标注的c-x-u(上下文-系统-用户)三元组,用户反馈的Fleiss Kappa值为0.515。
  • 使用TF-IDF加权的n-gram特征(n=1,2)对拼接的上下文、系统响应和用户话语进行分类和回归模型训练。
  • 使用准确率和平均绝对误差(MAE)评估模型性能,由于用户反馈具有序数性质,回归方法更优。
  • 探索一种仅使用用户下一句话语作为输入的通用用户满意度模型,结果显示准确率达60.3%,MAE为0.81。

实验结果

研究问题

  • RQ1如何设计一种评估智能代理性能的方法,使其优先考虑用户体验而非代理中心指标?
  • RQ2用户的下一句话语在多大程度上可作为系统前一响应质量的可靠指标?
  • RQ3能否仅基于用户话语训练出的模型实现高准确率预测用户满意度,从而减少对昂贵完整对话标注的依赖?
  • RQ4传统评估方法在孤立评估系统响应而未考虑用户反馈时存在哪些局限性?
  • RQ5如何设计代理系统,使其能通过实时反馈动态适应用户需求,真正作为合作伙伴发挥作用?

主要发现

  • 仅使用用户下一句话语(u)作为输入的模型,在预测用户满意度方面达到60.3%的准确率和0.81的MAE,表明其具有强大的预测能力。
  • 使用上下文、系统响应和用户话语(c-x-u)的完整模型达到65.8%的准确率和0.67的MAE,优于仅使用上下文和系统响应的模型。
  • S_sys < S_usr(18.6%)与S_sys > S_usr(35.0%)之间的差异表明,孤立评估使系统质量被高估近一倍。
  • 由于用户反馈具有序数性质,回归模型在此任务中优于分类模型,减少了相邻质量等级之间的混淆。
  • 用户反馈标注的Fleiss Kappa值高达0.515,证实标注者间一致性显著,验证了NUF指标的可靠性。
  • 将用户下一句话语作为系统质量的信号,相比仅基于上下文或仅基于响应的传统评估方法,能实现更准确、更以用户为中心的评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。