Skip to main content
QUICK REVIEW

[논문 리뷰] I can attend a meeting too! Towards a human-like telepresence avatar robot to attend meeting on your behalf

Hrishav Bakul Barua, Chayan Sarkar|arXiv (Cornell University)|2020. 06. 28.
Speech and Audio Processing참고 문헌 13인용 수 4
한 줄 요약

이 논문은 청각-시각적 인식을 통해 발화자를 국정하고 자연스럽게 주의를 이동시켜 원격 사용자 대신 회의에 자율적으로 참석하는 인간과 유사한 원격제어 로봇을 제안한다. 소리의 도착 시간 차이(TDOA)를 활용한 음향원 위치 특정과 얼굴 및 입술 움직임 감지를 결합하여 실시간으로 맥락 인식이 가능한 로봇의 방향 전환을 가능하게 하여 회의 참가자 간 소속감과 만족도를 향상시킨다.

ABSTRACT

Telepresence robots are used in various forms in various use-cases that helps to avoid physical human presence at the scene of action. In this work, we focus on a telepresence robot that can be used to attend a meeting remotely with a group of people. Unlike a one-to-one meeting, participants in a group meeting can be located at a different part of the room, especially in an informal setup. As a result, all of them may not be at the viewing angle of the robot, a.k.a. the remote participant. In such a case, to provide a better meeting experience, the robot should localize the speaker and bring the speaker at the center of the viewing angle. Though sound source localization can easily be done using a microphone-array, bringing the speaker or set of speakers at the viewing angle is not a trivial task. First of all, the robot should react only to a human voice, but not to the random noises. Secondly, if there are multiple speakers, to whom the robot should face or should it rotate continuously with every new speaker? Lastly, most robotic platforms are resource-constrained and to achieve a real-time response, i.e., avoiding network delay, all the algorithms should be implemented within the robot itself. This article presents a study and implementation of an attention shifting scheme in a telepresence meeting scenario which best suits the needs and expectations of the collocated and remote attendees. We define a policy to decide when a robot should rotate and how much based on real-time speaker localization. Using user satisfaction study, we show the efficacy and usability of our system in the meeting scenario. Moreover, our system can be easily adapted to other scenarios where multiple people are located.

연구 동기 및 목표

  • 원격 사용자 대신 최소한의 수동 조작으로 그룹 회의에 자율적으로 참석할 수 있는 원격제어 로봇을 가능하게 하기 위해.
  • 다수의 발화자가 존재하는 회의 환경에서 로봇이 현재 발화자를 식별하고 집중해야 하는 동적 주의 이동 문제를 해결하기 위해.
  • 인간과 유사한 주의 행동을 통해 원격 및 현장 참가자 모두의 소속감과 사회적 존재감을 향상시키기 위해.
  • TurtleBot2와 같은 자원 제약이 있는 로봇 플랫폼에 적합한 실시간 온디바이스 시스템을 설계하기 위해.
  • 참가자 수가 다양한 실제 회의 상황에서의 시스템 사용성과 사용자 만족도를 평가하기 위해.

제안 방법

  • 실시간 음향원 위치 특정(SSL)을 위해 라즈베리 파이 기반 마이크 어레이를 활용한 도착 시간 차이(TDOA)를 사용한다.
  • 시각적 주의를 위해 얼굴 감지와 입술 움직임 감지를 통합하여 발화자 위치 특정를 검증하고 정밀화한다.
  • 다수의 사람 존재 상황에서 발화자 간 주의 이동을 관리하기 위해 로봇 상태 표현 모델을 활용한다.
  • 발화 활동과 그룹 역학에 따라 언제, 얼마나 회전할지를 결정하기 위한 의사결정 규칙을 적용한다.
  • 네트워크 지연을 최소화하고 실시간 반응성을 확보하기 위해 전체 시스템을 TurtleBot2 플랫폼에 내장된 프로세싱으로 구현한다.
  • 앉아 있는 회의 구성에서 얼굴 감지를 최적화하기 위해 조절 가능한 카메라 마운트를 사용한다.

실험 결과

연구 질문

  • RQ1다양한 상황에서 자율적으로 현재 발화자를 감지하고 집중할 수 있는 원격제어 로봇은 어떻게 설계할 수 있는가?
  • RQ2다수의 발화자가 존재하는 회의에서 반응성, 정확도, 인간과 유사한 행동을 균형 있게 확보할 수 있는 주의 이동 전략은 무엇인가?
  • RQ3로봇의 자율적 행동이 원격 및 현장 참가자 모두의 소속감과 만족도를 어느 정도 향상시키는가?
  • RQ4실제 회의 상황에서 주의 정확도와 불필요한 방향 전환의 정도는 어떻게 평가되는가?
  • RQ5제안된 청각-시각적 인식 및 상태 모델은 자원 제약이 있는 로봇 플랫폼에서 실시간으로 효과적으로 구현될 수 있는가?

주요 결과

  • 원격 및 현장 참가자 모두가 평균 10점 만점에 7점으로 시스템의 소속감을 높게 평가하여 높은 사용자 만족도를 달성했다.
  • 평가 지표상 주의 이동 오류율이 낮아 불필요한 전환과 놓친 전환을 효과적으로 줄였다.
  • 발화자 감지 정확도가 높았으며, 특히 1:1 및 소규모 그룹 환경에서는 대부분의 경우 발화자를 정확히 식별했다.
  • 두 명 이상의 참가자가 있는 그룹에서의 주의 정확도는 일관되게 높았으며, 대부분의 상호작용에서 활성 발화자에게 정확히 집중했다.
  • 청각-시각적 인식 시스템은 원격 사용자 제어 없이도 인간과 유사한 행동—발화자 간 자연스러운 집중 이동과 눈맞춤 유지—을 가능하게 했다.
  • 사용자 피드백은 특히 다수의 참가자가 있는 회의에서 로봇이 원격 참가자의 개인적 존재감과 사회적 포용감을 향상시켰음을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.