[论文解读] MuMMER: Socially Intelligent Human-Robot Interaction in Public Spaces
MuMMER 提出了一套社会智能的自主机器人系统,适用于公共场所的人机交互,通过 ROS 集成音视频感知、社交信号处理、对话式人工智能以及以人为本的运动规划。该系统在芬兰一家购物中心部署,实现了自然、多模态的交互,包括引导导航、问答互动和开放式对话,在真实环境中表现出稳健的实时性能,通过远程处理和模块化组件集成实现极低延迟。
In the EU-funded MuMMER project, we have developed a social robot designed to interact naturally and flexibly with users in public spaces such as a shopping mall. We present the latest version of the robot system developed during the project. This system encompasses audio-visual sensing, social signal processing, conversational interaction, perspective taking, geometric reasoning, and motion planning. It successfully combines all these components in an overarching framework using the Robot Operating System (ROS) and has been deployed to a shopping mall in Finland interacting with customers. In this paper, we describe the system components, their interplay, and the resulting robot behaviours and scenarios provided at the shopping mall.
研究动机与目标
- 开发一种社会智能机器人,能够在开放、动态的环境(如购物中心)中与普通公众进行自然、灵活的交互。
- 通过 ROS 将多种人工智能组件——音视频感知、社交信号处理、对话式人工智能和运动规划——整合为统一的实时系统。
- 在真实世界部署中评估该系统,包括在嘈杂、不可预测的公共环境中与未经训练的用户进行长期交互。
- 支持多种多模态交互模式,如聊天、问答和路线引导,具备自适应、上下文感知的行为。
- 通过长期部署和用户研究,证明在真实公共场所实现自主、社会适宜的机器人行为的可行性。
提出的方法
- 系统使用卷积姿态机(CPM)和 OpenHeadPose 实现实时准确的人体检测、头部姿态估计和视觉跟踪。
- 基于粒子滤波的头部姿态追踪器通过颜色和面部特征实现跨帧的个体重新识别,使用 OpenFace 嵌入进行身份匹配。
- 一个多任务深度神经网络处理四通道音频输入,实现语音/非语音检测与声源定位的联合处理,从而在嘈杂环境中实现稳健的语音追踪。
- 通过将检测到的语音与面向机器人的个体关联,利用头部姿态作为视觉注意力的代理,实现语音与视觉注意力的融合。
- 对话系统使用 Alana NLU,芬兰版本通过 Google Translate 实现芬兰语-英语翻译,英文版本使用完整 NLU 流程,芬兰版本则采用基于模板的响应以确保鲁棒性。
- 任务执行通过中央仲裁模块协调,该模块管理交错的交互模式(聊天、问答、引导),并根据用户输入和上下文自适应调整行为。
实验结果
研究问题
- RQ1机器人如何在动态、嘈杂的公共环境(如购物中心)中,与未经训练的用户保持持续、社会适宜的交互?
- RQ2哪些音视频感知、社交信号处理与对话式人工智能的组合能够实现实时、自然的多模态人机交互?
- RQ3机器人如何在保持上下文和用户参与度的前提下,有效在不同交互模式(如聊天、问答、引导)之间切换?
- RQ4换位思考与几何推理在实现以人为本的导航和指向行为(特别是在路线引导期间)中起到什么作用?
- RQ5模块化、基于 ROS 的架构如何在真实世界部署中支持深度学习组件的实时集成,同时保持低延迟?
主要发现
- MuMMER 系统在购物中心成功部署三个月,证明了其在真实世界、嘈杂环境中与未经训练用户持续进行实时交互的能力。
- CPM 人体检测与 OpenHeadPose 的集成实现了跨帧的准确头部姿态跟踪与个体重新识别,即使在部分遮挡情况下也表现良好。
- 用于音频处理的多任务神经网络在嘈杂的商场环境中实现了稳健的声源定位与语音检测,性能通过合成数据和半自动数据收集得到增强。
- 通过将繁重计算(ASR、NLU、对话管理)卸载至远程服务器,系统实现了低延迟交互,显著减少了用户语音与机器人响应之间的延迟。
- 机器人成功执行了复杂的交错任务,如在保持对话的同时引导用户前往商店,能适应中断并主动提出重复指令。
- 使用 Google Translate 实现芬兰语-英语翻译,支持多语言部署,但因性能限制,芬兰版本采用简化的模板化响应系统,确保了系统鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。