[论文解读] Look at Me When I Talk to You: A Video Dataset to Enable Voice Assistants to Recognize Errors
本论文介绍了一个开源视频数据集,包含21名参与者在与语音助手互动时的面部反应,表明仅凭面部表情即可判断助手是否出错。通过众包工作者对无声视频片段中的反应进行分类,研究显示仅凭视觉线索即可有效识别语音助手错误,为对话式人工智能的自我修复机制铺平道路。
People interacting with voice assistants are often frustrated by voice assistants' frequent errors and inability to respond to backchannel cues. We introduce an open-source video dataset of 21 participants' interactions with a voice assistant, and explore the possibility of using this dataset to enable automatic error recognition to inform self-repair. The dataset includes clipped and labeled videos of participants' faces during free-form interactions with the voice assistant from the smart speaker's perspective. To validate our dataset, we emulated a machine learning classifier by asking crowdsourced workers to recognize voice assistant errors from watching soundless video clips of participants' reactions. We found trends suggesting it is possible to determine the voice assistant's performance from a participant's facial reaction alone. This work posits elicited datasets of interactive responses as a key step towards improving error recognition for repair for voice assistants in a wide variety of applications.
研究动机与目标
- 为解决语音助手在交互过程中往往无法检测自身错误的问题。
- 探究面部反应是否可作为语音助手错误的可靠指示器,从而实现实时检测与自我修复。
- 创建并发布一个公开可用、符合伦理规范的视频数据集,记录用户对语音助手正确回应、错误回应或无回应的反应。
- 验证仅基于视觉线索训练机器学习模型以识别语音助手错误的可行性。
- 为未来基于真实人类交互数据的研究奠定基础,涵盖错误检测、错误修复以及语音交互系统中的对话对齐问题。
提出的方法
- 在自然环境中录制21名参与者与Amazon Alexa互动的音频和视频,从智能音箱的视角进行记录。
- 提取并剪切显示参与者在回应Alexa回答时面部表情的无声视频片段。
- 将每个视频片段分类为三类:正确回应(YES)、错误回应(NO)或无回应(OMIT)。
- 利用Amazon Mechanical Turk上的众包工作者,将无声视频片段标记为表示错误(NO)或无错误(YES/OMIT)。
- 使用标注后的数据集,模拟仅基于面部表情的机器学习分类器,用于错误识别。
- 实施伦理保障措施,包括IRB批准、参与者知情同意,以及仅向通过IRB审查的研究人员提供数据访问权限。
实验结果
研究问题
- RQ1仅凭面部表情是否能可靠地指示语音助手在对话中是否出错?
- RQ2众包工作者在仅观看用户反应的无声视频片段时,检测语音助手错误的有效性如何?
- RQ3与语音助手错误或无回应相关的最显著面部线索是什么?
- RQ4视觉反应数据在多大程度上可用于训练机器学习模型,以实现实时自动检测语音助手错误?
- RQ5互动式回应数据集在提升对话式人工智能系统自我修复机制开发方面有何作用?
主要发现
- 众包工作者在观看参与者面部反应的无声视频片段时,能够以显著的一致性对语音助手错误的存在进行分类。
- 研究发现面部表情存在明显趋势,例如摇头、翻白眼或无反应,这些均与助手回应错误或缺失相关。
- 参与者对错误回应(如摇头)和无回应(如沉默或目光转移)表现出不同的视觉反应,表明存在可检测的模式。
- 该数据集表明,即使没有音频,面部反应也包含足够信息以推断助手的表现。
- 本研究验证了仅使用视觉线索训练语音助手错误检测模型的可行性,支持未来实现实时、设备端的推理。
- 通过IRB批准、知情同意和受限数据访问,妥善处理了伦理问题,确保敏感生物特征数据的负责任使用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。