[论文解读] Setting Up Pepper For Autonomous Navigation And Personalized Interaction With Users
本文提出了一种集成软件架构,通过结合ROS实现实时定位与导航,以及基于云的语音和人脸识别服务,提升了Pepper机器人的自主性与个性化交互能力。该系统使Pepper能够自主导航环境,通过人脸识别识别可信用户,并通过结合语音、平板输入和LED反馈的多模态界面响应语音指令,在真实的人机交互场景中表现出稳健性能。
In this paper we present our work with the Pepper robot, a service robot from SoftBank Robotics. We had two main goals in this work: improving the autonomy of this robot by increasing its awareness of the environment; and enhance the robot ability to interact with its users. To achieve this goals, we used ROS, a modern open-source framework for developing robotics software, to provide Pepper with state of the art localization and navigation capabilities. Furthermore, we contribute an architecture for effective human interaction based on cloud services. Our architecture improves Pepper speech recognition capabilities by connecting it to the IBM Bluemix Speech Recognition service and enable the robot to recognize its user via an in-house face recognition web-service. We show examples of our successful integration of ROS and IBM services with Pepper's own software. As a result, we were able to make Pepper move autonomously in a environment with humans and obstacles. We were also able to have Pepper execute spoken commands from known users as well as newly introduced users that were enrolled in the robot list of trusted users via a multi-modal interface.
研究动机与目标
- 通过基于ROS的SLAM与定位技术,提升Pepper机器人对环境的感知能力与导航自主性。
- 通过人脸识别与用户注册功能,实现对已知与新用户的个性化人机交互。
- 通过将音频流式传输至云端ASR服务,在保持实时响应的同时,降低语音识别延迟并提高鲁棒性。
- 通过平板、LED与触觉传感器实现多模态反馈,提升交互透明度与用户参与感。
- 展示一个完全集成的端到端系统,结合ROS、NAOqi与云服务,实现可扩展的个性化机器人交互。
提出的方法
- 将ROS Indigo与Pepper专有的NAOqi框架集成,利用ASUS Xtion三维传感器与激光数据,实现实时定位、建图与自主导航。
- 在Pepper胸部平板上部署本地Web服务器,托管动态网页,通过AJAX与TCP回程通信实现实时文本字幕显示与输入收集。
- 将Pepper的麦克风阵列连接至IBM Bluemix语音识别服务,提升语音理解能力,尤其针对未登录词汇。
- 开发自定义人脸识别Web服务,用于存储与匹配用户面部信息,支持通过平板输入姓名与拍摄图像实现用户注册。
- 利用LED(特别是眼睛与肩部LED)指示听音状态与机器人状态,提升非语言沟通效果。
- 设计多模态交互流程,使语音、平板输入与触摸操作并行运行,提升系统可靠性与用户透明度。
实验结果
研究问题
- RQ1ROS能否有效集成至Pepper的NAOqi框架中,以实现稳定、实时的自主导航?
- RQ2基于云的语音识别在移动机器人上的人机交互中,如何提升准确率并降低延迟?
- RQ3通过平板实现的人脸识别与用户注册,在多大程度上能增强服务机器人的个性化与访问控制能力?
- RQ4多模态接口(语音、平板、LED)在多大程度上能改善用户对机器人状态与交互可靠性的感知?
- RQ5结合本地ROS处理与远程云服务的混合架构,能否在真实环境中实现低延迟、高准确率的交互?
主要发现
- ROS Indigo与Pepper NAOqi框架的集成,成功实现了基于SLAM与地图路径规划的稳定、实时定位与导航。
- 得益于基于云的ASR处理管道,Pepper在嘈杂环境中仍能高精度识别并响应已知用户的语音指令。
- 人脸识别系统能正确识别可信用户并阻止未授权访问,新用户可通过平板输入姓名与拍摄图像完成注册。
- 平板输入机制有效克服了语音识别失败的问题,尤其在处理未登录姓名时,允许用户通过键盘输入指令。
- 在平板上使用动态网页实现实时字幕与状态反馈,显著提升了用户对机器人状态与处理过程的认知。
- 结合语音、触摸、LED与平板的多模态接口,使交互过程更加透明可靠,经真实场景演示(面向中学生访客)验证有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。