Skip to main content
QUICK REVIEW

[논문 리뷰] Detection of social signals for recognizing engagement in human-robot interaction

Divesh Lala, Koji Inoue|arXiv (Cornell University)|2017. 09. 29.
Social Robot Interaction and HRI참고 문헌 25인용 수 10
한 줄 요약

이 논문은 인간-로봇 상호작용 중 사용자 참여도를 인식하기 위해 Kinect 및 마이크 배열 데이터를 이용해 사회적 신호—점시, 웃음, 말의 후속 반응, 시선 방향—를 실시간으로 탐지하는 시스템을 제안한다. 자동으로 탐지된 신호를 사용하여 합리적인 참여도 인식 성능(AUC = 0.620, 맥락 고려 시)을 달성함으로써, ERICA와 같은 로봇에서 참여도 인식 대화 전략을 효과적으로 지원하기 위해 저수준 신호 통합 탐지가 유의미하다는 것을 보여준다.

ABSTRACT

Detection of engagement during a conversation is an important function of human-robot interaction. The level of user engagement can influence the dialogue strategy of the robot. Our motivation in this work is to detect several behaviors which will be used as social signal inputs for a real-time engagement recognition model. These behaviors are nodding, laughter, verbal backchannels and eye gaze. We describe models of these behaviors which have been learned from a large corpus of human-robot interactions with the android robot ERICA. Input data to the models comes from a Kinect sensor and a microphone array. Using our engagement recognition model, we can achieve reasonable performance using the inputs from automatic social signal detection, compared to using manual annotation as input.

연구 동기 및 목표

  • 인간-로봇 상호작용에서 사용자 참여도를 나타내는 핵심 사회적 신호를 실시간으로 탐지하기 위한 모델을 개발한다.
  • 이러한 신호 탐지 모델을 로봇 시스템(ERICA)에 통합하여 참여도 인식 대화 전략을 지원한다.
  • 자동으로 탐지된 사회적 신호가 참여도 인식에서 수동 애너테이션을 효과적으로 대체할 수 있는지 평가한다.
  • 이전 턴의 참여도와 같은 맥락 정보가 참여도 인식 성능에 미치는 영향을 평가한다.

제안 방법

  • 안드로이드 로봇 ERICA를 사용해 91개의 인간-로봇 상호작용 세션을 코퍼스로 수집하였으며, Kinect와 마이크 어레이를 통해 시각적 및 청각적 데이터를 기록하였다.
  • 제3자 관찰자로부터 애너테이션된 데이터를 기반으로 기계학습을 이용해 점시, 웃음, 말의 후속 반응, 시선 방향에 대한 개별 모델을 훈련시켰다.
  • 잠재적 관찰자 특성(주관적 애너테이션 차이를 보완하기 위함)을 고려한 계층적 베이지안 모델을 사용해 참여도를 추론하였다.
  • 정밀도-재현율 곡선 아래 면적(AUC)을 사용해 두 가지 입력 조건(수동 애너테이션 및 탐지된 신호) 하에서의 참여도 인식 성능을 평가하였다.
  • 로봇의 이전 턴 참여도를 고려한 맥락 특성이 있는지 여부에 따라 모델 성능을 비교하였다.
  • 모든 신호 탐지 모델을 ERICA 아키텍처에 통합하여 자연스러운 대화 환경에서 실시간 배포를 구현하였다.

실험 결과

연구 질문

  • RQ1점시, 웃음, 말의 후속 반응, 시선 방향 중 어떤 사회적 신호가 인간-로봇 상호작용에서 사용자 참여도를 가장 잘 예측하는가?
  • RQ2이러한 신호의 자동 탐지가 실시간으로 신뢰할 만한 참여도 인식을 지원하기에 충분한 정확도를 달성할 수 있는가?
  • RQ3자동으로 탐지된 신호를 사용할 경우 수동 애너테이션 입력을 사용할 경우와 비교해 참여도 인식 성능는 어떻게 되는가?
  • RQ4이전 턴의 참여도와 같은 맥락 정보를 통합할 경우 참여도 인식 성능가 얼마나 향상되는가?
  • RQ5개별 신호 탐지 모델들이 함께 기여할 때 전체 참여도 인식 성능에 어떤 영향을 미치는가?

주요 결과

  • 수동 애너테이션 입력에 맥락 정보를 고려할 경우 참여도 인식 모델은 AUC 0.669를 달성하여 강력한 기준 성능을 보였다.
  • 탐지된 신호를 입력으로 사용할 경우 맥락 특성을 고려할 경우 AUC 0.620을 달성하여, 성능 저하가 있음에도 불구하고 자동 탐지가 실현 가능하다는 것을 입증하였다.
  • 수동 애너테이션에서 탐지로의 성능 저하가 미미하여, 통합된 저수준 신호 탐지가 참여도 인식에 효과적임을 시사한다.
  • 후속 반응 탐지 성능이 웃음 탐지 성능보다 유의미하게 뛰어나, 웃음 탐지 성능은 낮은 인식 성능를 보였다.
  • 수동 및 탐지 기반 설정 모두에서 맥락 정보를 추가함으로써 성능 향상이 있었으며, 이는 시간적 모델링의 가치를 입증한다.
  • 개별 모델의 한계가 있었음에도 불구하고, 탐지된 신호의 통합은 참여도 인식에 충분한 입력을 제공하였으며, 실시간 배포를 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.