Skip to main content
QUICK REVIEW

[논문 리뷰] Setting Up Pepper For Autonomous Navigation And Personalized Interaction With Users

Vittorio Perera, Tiago Pereira|arXiv (Cornell University)|2017. 04. 16.
Speech and dialogue systems참고 문헌 1인용 수 16
한 줄 요약

이 논문은 ROS를 사용한 실시간 위치 추정 및 주행과 클라우드 기반 음성 및 얼굴 인식 서비스를 결합하여 페퍼 로봇의 자율성과 개인화된 상호작용을 향상시키는 통합 소프트웨어 아키텍처를 제시한다. 이 시스템은 페퍼 로봇이 환경을 자율적으로 주행하고, 얼굴 인식을 통해 신뢰할 수 있는 사용자를 식별하며, 음성, 태블릿 입력, LED 피드백을 활용한 다중모달 인터페이스를 통해 명령에 응답할 수 있도록 한다. 이는 실제 인간-로봇 상호작용 시나리오에서 뛰어난 성능을 입증한다.

ABSTRACT

In this paper we present our work with the Pepper robot, a service robot from SoftBank Robotics. We had two main goals in this work: improving the autonomy of this robot by increasing its awareness of the environment; and enhance the robot ability to interact with its users. To achieve this goals, we used ROS, a modern open-source framework for developing robotics software, to provide Pepper with state of the art localization and navigation capabilities. Furthermore, we contribute an architecture for effective human interaction based on cloud services. Our architecture improves Pepper speech recognition capabilities by connecting it to the IBM Bluemix Speech Recognition service and enable the robot to recognize its user via an in-house face recognition web-service. We show examples of our successful integration of ROS and IBM services with Pepper's own software. As a result, we were able to make Pepper move autonomously in a environment with humans and obstacles. We were also able to have Pepper execute spoken commands from known users as well as newly introduced users that were enrolled in the robot list of trusted users via a multi-modal interface.

연구 동기 및 목표

  • ROS 기반 SLAM 및 위치 추정을 통해 페퍼 로봇의 환경 인식 능력과 주행 자율성을 향상시킨다.
  • 얼굴 인식 및 사용자 등록을 통해 기존 사용자와 신규 사용자를 식별함으로써 개인화된 인간-로봇 상호작용을 가능하게 한다.
  • 실시간 반응성을 유지하면서도 오디오 스트리밍을 클라우드 ASR 서비스에 전달하여 음성 인식 지연을 줄이고 정확도를 향상시킨다.
  • 태블릿, LED, 촸각 센서를 활용한 다중모달 피드백을 통합하여 상호작용의 투명성과 사용자 참여도를 향상시킨다.
  • ROS, NAOqi, 클라우드 서비스를 통합한 엔드 투 엔드 시스템을 통해 확장 가능하고 개인화된 로봇 상호작용을 구현한다.

제안 방법

  • 페퍼의 전용 NAOqi 프레임워크와 ROS Indigo를 통합하여, ASUS Xtion 3D 센서와 레이저 데이터를 활용한 실시간 위치 추정, 지ap 맵 생성, 자율 주행을 가능하게 한다.
  • 페퍼의 가슴 태블릿에 로컬 웹 서버를 구축하여 AJAX 및 TCP 백채널 통신을 통해 실시간 텍스트 캡션 표시 및 입력 수집을 위한 동적 웹 페이지를 호스팅한다.
  • 마이크 배열을 IBM Bluemix 음성 인식 서비스에 연결하여, 특히 어휘에 없는 단어에 대해 음성 이해 능력을 향상시킨다.
  • 사용자 얼굴을 저장하고 매칭하는 커스터마이징된 얼굴 인식 웹 서비스를 구축하여, 태블릿 기반의 이름 입력과 이미지 촬영을 통해 사용자 등록 기능을 제공한다.
  • 특히 눈과 어깨에 위치한 LED를 사용해 청취 상태와 로봇의 상태를 알리며, 비언어적 의사소통을 향상시킨다.
  • 음성, 태블릿 입력, 촉각을 동시에 활용하는 다중모달 상호작용 파이프라인을 설계하여 신뢰성과 사용자 투명성을 높였다.

실험 결과

연구 질문

  • RQ1ROS는 페퍼의 NAOqi 프레임워크와 효과적으로 통합되어 실시간 자율 주행을 위한 안정적이고 신뢰할 수 있는 성능을 발휘할 수 있는가?
  • RQ2클라우드 기반 음성 인식은 이동형 로봇에서 인간-로봇 상호작용의 정확도를 향상시키고 지연을 줄일 수 있는가?
  • RQ3태블릿 기반 얼굴 인식 및 사용자 등록은 서비스 로봇에서 개인화 및 접근 제어 수준을 얼마나 향상시킬 수 있는가?
  • RQ4다중모달 인터페이스(음성, 태블릿, LED)는 사용자가 로봇 상태와 상호작용의 신뢰성을 어떻게 향상시키는가?
  • RQ5현장 환경에서 저지연, 고정확도의 상호작용을 달성하기 위해 로컬 ROS 처리와 원격 클라우드 서비스를 융합한 하이브리드 아키텍처는 가능한가?

주요 결과

  • ROS Indigo와 페퍼의 NAOqi 프레임워크 통합을 통해 SLAM 및 지도 기반 경로 계획을 활용한 안정적이고 실시간의 위치 추정 및 주행이 가능해졌다.
  • 클라우드 기반 ASR 파이프라인 덕분에, 소음이 있는 환경에서도 신뢰할 수 있는 사용자로부터의 명령을 고정확도로 인식하고 응답하는 데 성공했다.
  • 얼굴 인식 시스템은 신뢰할 수 있는 사용자를 정확히 식별하고 무단 접근을 방지했으며, 신규 사용자는 태블릿 기반의 이름 입력과 이미지 촬영을 통해 등록되었다.
  • 태블릿 기반 입력 메커니즘이 음성 인식 실패 시, 특히 어휘에 없는 이름에 대해 사용자가 명령어를 타이핑할 수 있도록 하여 효과적으로 보완되었다.
  • 태블릿에 실시간 캡션 표시 및 상태 피드백을 제공하는 동적 웹 페이지 사용으로 사용자가 로봇 상태와 처리 과정을 보다 명확히 인지할 수 있게 되어 사용자 인지도 향상되었다.
  • 음성, 촉각, LED, 태블릿을 통합한 다중모달 인터페이스는 실제 중학생 방문자 대상 데모를 통해 검증되었으며, 더 투명하고 신뢰할 수 있는 상호작용 경험을 제공했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.