[论文解读] "Is there anything else I can help you with?": Challenges in Deploying an On-Demand Crowd-Powered Conversational Agent
本文提出 Chorus,一种基于众包的对话代理,可按需实时招募人类工作者生成回应,从而支持自然的多轮对话。尽管在支持 320 次会话、涉及 59 名用户的部署中取得成功,但暴露出了对话终止、工作者与用户安全、按需招募以及超越简单共识的持续集体身份维持等关键挑战。
Intelligent conversational assistants, such as Apple's Siri, Microsoft's Cortana, and Amazon's Echo, have quickly become a part of our digital life. However, these assistants have major limitations, which prevents users from conversing with them as they would with human dialog partners. This limits our ability to observe how users really want to interact with the underlying system. To address this problem, we developed a crowd-powered conversational assistant, Chorus, and deployed it to see how users and workers would interact together when mediated by the system. Chorus sophisticatedly converses with end users over time by recruiting workers on demand, which in turn decide what might be the best response for each user sentence. Up to the first month of our deployment, 59 users have held conversations with Chorus during 320 conversational sessions. In this paper, we present an account of Chorus' deployment, with a focus on four challenges: (i) identifying when conversations are over, (ii) malicious users and workers, (iii) on-demand recruiting, and (iv) settings in which consensus is not enough. Our observations could assist the deployment of crowd-powered conversation systems and crowd-powered systems in general.
研究动机与目标
- 探索在现实世界中按需部署众包对话代理的可行性与挑战。
- 理解用户与众包工作者在开放、长期部署的此类系统中的互动方式。
- 识别在人机协同对话系统中维持对话完整性、工作者安全与用户信任的系统性挑战。
- 评估工作者共识与按需招募在维持自然、持久对话中的局限性。
提出的方法
- Chorus 通过 Google Hangouts 部署,允许用户通过各种设备上的标准消息界面进行交互。
- 系统为每个用户发言实时从 Amazon Mechanical Turk 动态招募众包工作者。
- 工作者会看到对话历史,并被要求生成下一条回应,不使用预定义模板或脚本。
- 采用共识机制对回应进行过滤,但当共识不可行时,系统也允许单个工作者的回应。
- 系统通过将回应归因于单一代理(Chorus)来维持持久的对话身份,尽管多个工作者参与了贡献。
- 实施了反馈与监控机制,包括与工作者和用户的直接沟通渠道,以及交互日志的记录以供分析。
实验结果
研究问题
- RQ1在现实使用中,众包对话代理如何有效判断对话已结束?
- RQ2在开放、非监管的众包系统部署中,恶意用户与工作者会引发哪些挑战?
- RQ3在保持低延迟与高响应质量的前提下,按需工作者招募在多大程度上可实现可持续扩展?
- RQ4当回应来自不同工作者时,如何在多轮对话中维持一致的集体身份?
主要发现
- Chorus 在部署的第一个月内支持了 320 次对话会话,涉及 59 名独立用户,证明了长期、实时众包对话的可行性。
- 用户频繁表现出意外行为,如头脑风暴、校对、语言学习以及讨论个人问题,表明其在任务导向查询之外具有广泛的创造性潜力。
- 工作者经常自发暴露其身份,破坏了单一对话代理的幻觉,挑战了系统对持久身份设计的初衷。
- 尽管有共识机制,维持连贯的对话身份仍具挑战,因为不同工作者的回应在语气和风格上存在显著差异。
- 按需招募成本高昂且不可靠,因为工作者更倾向于可预测、重复性的任务,而非一次性、时间敏感的互动。
- 恶意用户偶尔发送侮辱性内容,工作者也暴露于有害或不适当的要求之下,凸显了对更优内容过滤与工作者保护机制的需求。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。