[논문 리뷰] MuMMER: Socially Intelligent Human-Robot Interaction in Public Spaces
MuMMER는 ROS를 통해 음성-시각적 인식, 사회적 신호 처리, 대화형 AI, 인간 인식 운동 계획을 통합한 사회적으로 지능적인 자율 로봇 시스템을 공공 공간에서 인간-로봇 상호작용에 적용한다. 페투리아의 쇼핑몰에 배치된 시스템은 가이드 탐색, 퀴즈, 개방형 대화를 포함한 자연스럽고 다중 모odal 상호작용을 가능하게 하며, 원격 처리 및 모듈식 구성 요소 통합을 통해 실시간 성능이 뛰어나고 지연이 최소화된 실생활 조건에서의 안정성을 입증한다.
In the EU-funded MuMMER project, we have developed a social robot designed to interact naturally and flexibly with users in public spaces such as a shopping mall. We present the latest version of the robot system developed during the project. This system encompasses audio-visual sensing, social signal processing, conversational interaction, perspective taking, geometric reasoning, and motion planning. It successfully combines all these components in an overarching framework using the Robot Operating System (ROS) and has been deployed to a shopping mall in Finland interacting with customers. In this paper, we describe the system components, their interplay, and the resulting robot behaviours and scenarios provided at the shopping mall.
연구 동기 및 목표
- 공개적이고 역동적인 환경인 쇼핑몰과 같은 장소에서 일반 대중과 자연스럽고 융통성 있는 상호작용을 할 수 있는 사회적으로 지능적인 로봇을 개발하는 것.
- ROS를 사용하여 음성-시각적 인식, 사회적 신호 처리, 대화형 AI, 운동 계획 등의 다수의 AI 구성 요소를 통합한 통합형 실시간 시스템을 개발하는 것.
- 장기간의 사용자 상호작용을 포함한 실생활 배치를 통해, 소음이 많고 예측 불가능한 공공 환경에서의 시스템 평가를 수행하는 것.
- 대화, 퀴즈, 경로 안내와 같은 다중 모달 상호작용 모드를 통해 적응형이고 맥락 인식 기반의 행동을 가능하게 하는 것.
- 장기간의 배치와 사용자 연구를 통해 실생활 공공 공간에서 자율적이고 사회적으로 적절한 로봇 행동의 실현 가능성을 입증하는 것.
제안 방법
- 시스템은 실시간으로 사람 탐지, 머리 자세 추정, 시각적 추적을 위해 컨volutional pose machines (CPM)과 OpenHeadPose를 사용한다.
- 색상 및 얼굴 특징을 기반으로 한 입자 필터 기반 머리 자세 추적기가 프레임 간에 개인을 재식별할 수 있도록 하며, 신원 매칭을 위해 OpenFace 임베딩을 활용한다.
- 4채널 음성 입력을 처리하기 위한 다중 작업 딥 네트워크가 음성/비음성 탐지와 소리의 원천 위치 특정를 동시에 수행하여 소음이 많은 환경에서의 음성 추적 능력을 향상시킨다.
- 로봇이 향하고 있는 사람과의 음성 탐지 간의 연관성을 통해 음성과 시각적 주의 집중을 융합하며, 머리 자세를 주의 집중의 지표로 사용한다.
- 대화 시스템은 Alana NLU를 사용하며, 핀란드어-영어 번역을 위해 Google Translate를 활용한다. 핀란드어 버전은 견고성을 확보하기 위해 템플릿 기반 응답 방식을 사용하고, 영어 모드는 전체 NLU 파이프라인을 사용한다.
- 작업 실행은 중앙 조정 모듈을 통해 조율되며, 대화, 퀴즈, 안내와 같은 상호작용 모드를 겹쳐 처리하고 사용자 입력 및 맥락에 따라 행동을 적응시킨다.
실험 결과
연구 질문
- RQ1어떻게 로봇은 소음이 많고 역동적인 공공 환경인 쇼핑몰에서 훈련되지 않은 사용자와 지속적이고 사회적으로 적절한 상호작용을 유지할 수 있는가?
- RQ2어떤 음성-시각적 인식, 사회적 신호 처리, 대화형 AI의 조합이 실시간으로 자연스럽고 다중 모달 인간-로봇 상호작용을 가능하게 하는가?
- RQ3로봇은 어떻게 다양한 상호작용 모드(예: 대화, 퀴즈, 안내) 사이를 효과적으로 전환하면서 맥락과 사용자 참여를 유지할 수 있는가?
- RQ4경로 안내 중 인간 인식 주행 및 가리키기 행동을 가능하게 하는 데 있어 관점 공유 및 기하학적 추론의 역할은 무엇인가?
- RQ5모듈식이고 ROS 기반 아키텍처는 실생활 배치에서 딥 러닝 구성 요소를 실시간으로 통합하면서도 저지연을 유지하는 데 어떻게 기여하는가?
주요 결과
- MuMMER 시스템은 쇼핑몰에 3개월간 배치되어 실제 소음이 많은 환경에서 훈련되지 않은 사용자와 지속적인 실시간 상호작용을 성공적으로 수행하였다.
- CPM 기반의 사람 탐지와 OpenHeadPose의 통합은 부분적으로 가림을 겪더라도 프레임 간에 정확한 머리 자세 추적과 개인 재식별을 가능하게 하였다.
- 음성 처리를 위한 다중 작업 신경망은 소음이 많은 쇼핑몰 환경에서 안정적인 소리의 원천 위치 특정 및 음성 탐지 성능을 달성하였으며, 합성 및 반자동 데이터 수집을 통해 성능이 향상되었다.
- 중요한 계산 작업(ASR, NLU, 대화 관리)을 원격 서버로 이관함으로써 낮은 지연을 달성하여 사용자 음성과 로봇 응답 사이의 지연을 최소화하였다.
- 로봇은 대화를 유지하면서 상점으로 유도하는 복잡한 상호작용을 수행하였고, 간섭 상황에 대응하고 지시를 반복할 수 있도록 적응하였다.
- Google Translate를 활용한 핀란드어-영어 번역은 다국어 배포를 가능하게 하였지만, 성능 한계로 인해 핀란드어 버전에서는 단순화된 템플릿 기반 응답 시스템을 도입하여 견고성을 확보하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.