Skip to main content
QUICK REVIEW

[论文解读] A System for Human-AI collaboration for Online Customer Support

Debayan Banerjee, Mathis Poser|arXiv (Cornell University)|Jan 28, 2023
AI in Service Interactions被引用 5
一句话总结

本文提出了一种用于在线客户服务的实时人机协作系统,其中AI代理被动监听人工客服的对话,并仅向客服显示相关常见问题(FAQ)建议。在德语学生咨询数据集上的评估显示,该系统显著降低了客服工作负担——FAQ建议的MRR达到0.5或以上,且每轮交互中平均使用六条建议,同时通过有效的无建议检测机制保持了低噪声水平。

ABSTRACT

AI enabled chat bots have recently been put to use to answer customer service queries, however it is a common feedback of users that bots lack a personal touch and are often unable to understand the real intent of the user's question. To this end, it is desirable to have human involvement in the customer servicing process. In this work, we present a system where a human support agent collaborates in real-time with an AI agent to satisfactorily answer customer queries. We describe the user interaction elements of the solution, along with the machine learning techniques involved in the AI agent.

研究动机与目标

  • 开发一种混合人机系统,支持客服人员而不取代他们,重点在于减轻认知负荷并缩短响应时间。
  • 设计一种被动式AI代理,监听人工客服对话,并仅在适当情况下提供相关FAQ建议,避免不必要的干扰。
  • 评估该系统在真实人类客服人员处理志愿者组织中学生咨询时的可用性与实际影响。
  • 校准AI模型,以在FAQ建议与无建议检测两方面实现性能平衡,最大限度减少噪声与误报。
  • 改进反馈机制,以支持未来在线学习,使系统能够基于人工客服的修正进行自适应优化。

提出的方法

  • 基于ReactJS和Flask构建的基于Web的用户界面,支持人工客服与AI之间的实时交互,聊天界面基于Rocket.Chat实现。
  • AI代理使用机器学习模型根据对话上下文对FAQ进行排序,显示前两条建议,其余四条可通过“丢弃”按钮访问。
  • 系统包含一个反馈功能,允许客服人员提交搜索词,以将互动与相关FAQ关联,但在评估期间未用于在线模型微调。
  • AI模型被训练以同时预测相关FAQ建议与“无建议”响应,性能通过两类任务的MRR@10进行评估。
  • 收集并标注了183段德语对话,附带FAQ ID,作为模型训练与评估的基础。
  • 系统采用双重评估方法:基于MRR的自动化模型评估,以及通过访谈与屏幕录制进行的定性人工评估。

实验结果

研究问题

  • RQ1如何设计AI代理,使其在不直接与用户交互的情况下,实现实时客户服务支持?
  • RQ2FAQ建议准确率与无建议检测性能之间应如何达到最佳平衡,以最小化客服工作负担与噪声?
  • RQ3人工客服在真实客户服务场景中如何看待AI驱动的FAQ建议的可用性与实用性?
  • RQ4该系统在多大程度上减少了客服人员查找并提供正确答案所需的时间与精力?
  • RQ5如何有效整合人工客服的反馈以改进AI模型,从而提升长期性能?

主要发现

  • 人工客服每轮交互平均使用六条FAQ建议,18名客服中有17名至少使用三次“复制到聊天”按钮,表明系统参与度高。
  • 平均而言,客服在发送前编辑了两条建议内容,表明AI提供了有价值的起点,同时允许灵活定制。
  • “获取更多信息”按钮的使用频率(平均3.7次)高于简略版本(平均2.6次),表明客服重视详细上下文以辅助决策。
  • 客服每轮交互平均点击“丢弃”按钮15次,表明其积极探索其他建议选项,对推荐界面表现出高度参与。
  • AI模型在FAQ类别上实现了MRR ≥ 0.5,意味着正确FAQ通常排在前两位,显著减少了搜索时间。
  • 无建议类别性能至关重要:接近1.0的高MRR值对避免向客服推送无关建议至关重要,凸显了静默检测的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。