Skip to main content
QUICK REVIEW

[논문 리뷰] HARMONIC: A Multimodal Dataset of Assistive Human-Robot Collaboration

Benjamin A. Newman, Reuben M. Aronson|arXiv (Cornell University)|2018. 07. 30.
Cognitive Functions and Memory인용 수 7
한 줄 요약

HARMONIC은 6-DOF 로봇 암을 사용하여 보조 식사 작업 중 인간-로봇 협업을 촬영한 대규모 다중모달 데이터셋이다. 눈의 시선, 근전도(EMG), 스테레오 영상, 조작기 입력 및 로봇 운동학을 통합하여 보조 로봇 분야에서 의도 예측, 공유 자율성 및 인간 정서 상태 모델링 연구를 가능하게 한다.

ABSTRACT

We present the Human And Robot Multimodal Observations of Natural Interactive Collaboration (HARMONIC) data set. This is a large multimodal data set of human interactions with a robotic arm in a shared autonomy setting designed to imitate assistive eating. The data set provides human, robot, and environmental data views of twenty-four different people engaged in an assistive eating task with a 6 degree-of-freedom (DOF) robot arm. From each participant, we recorded video of both eyes, egocentric video from a head-mounted camera, joystick commands, electromyography from the forearm used to operate the joystick, third person stereo video, and the joint positions of the 6 DOF robot arm. Also included are several features that come as a direct result of these recordings, such as eye gaze projected onto the egocentric video, body pose, hand pose, and facial keypoints. These data streams were collected specifically because they have been shown to be closely related to human mental states and intention. This data set could be of interest to researchers studying intention prediction, human mental state modeling, and shared autonomy. Data streams are provided in a variety of formats such as video and human-readable CSV and YAML files.

연구 동기 및 목표

  • 보조 로봇 분야 연구를 지원하기 위해 공유 자율성 환경에서 인간-로봇 상호작용의 종합적이고 다중모달 데이터셋을 구축하기 위해.
  • 작업 수행 중 인간의 의도와 정서 상태와 관련된 비언어적 행동 신호(예: 눈의 시선, 근전도(EMG), 자세)를 캡처하기 위해.
  • 다양한 센서에서 동기화된 고해상도 데이터 스트림을 제공함으로써 의도 추론 및 인간-로봇 조율 연구를 가능하게 하기 위해.
  • 직접 원격 제어와 로봇 보조 제어 조건을 모두 포함함으로써 공유 자율성 연구를 지원하기 위해.
  • 인간 행동 모델링, 의도 예측, 적응형 로봇 제어에 대한 벤치마킹을 지원하기 위해 표준화되고 공개 가능한 데이터셋을 제공하기 위해.

제안 방법

  • 6-DOF Kinova Mico 로봇 암을 사용하여 24명의 참가자가 보조 식사 작업을 수행하는 동안 동기화된 데이터를 수집하였다.
  • 에고세트릭 RGB 영상, 이중 눈의 시선 추적(적외선), 제3인칭 스테레오 영상, 2D 조작기 입력(수동 모드 전환 가능)을 기록하였다.
  • 조작기 제어를 위한 전 forearm 근전도(EMG) 신호와 로봇 암 관절 위치를 측정하였다.
  • 눈의 시선을 에고세트릭 영상에 투영하고, 컴퓨터 비전 파이프라인을 통해 신체 자세, 손 자세, 얼굴 키포인트를 추출하였다.
  • 스테레오 영상 캡처 및 모든 모odal 간 타임스탬프 동기화에 Stereolabs ZED를 사용하였다.
  • 접근성과 재현 가능성을 위해 H.264 영상, CSV, YAML, NumPy 배열 등 다양한 형식으로 데이터를 저장하였다.

실험 결과

연구 질문

  • RQ1보조 인간-로봇 협업 중에 눈의 시선 패턴은 작업과 관련된 물체 상호작용과 어떻게 관련이 있는가?
  • RQ2근전도(EMG) 신호와 조작기 입력은 원격 제어 로봇 조작에서 사용자의 의도를 어느 정도 예측할 수 있는가?
  • RQ3직접 원격 제어와 공유 자율성의 다른 제어 모드는 인간-로봇 조율과 행동 역학에 어떤 영향을 미치는가?
  • RQ4다중모달 신호(시선, 근전도(EMG), 자세)를 효과적으로 융합하여 인간의 의도를 추론하고 로봇의 보조 기능을 향상시킬 수 있는가?
  • RQ5실제 보조 작업 환경에서 다양한 개인 간에 행동 신호(예: 시선, 근전도(EMG))의 신뢰성과 일관성은 어떠한가?

주요 결과

  • HARMONIC 데이터셋은 24명의 참가자를 포함하며, 눈의 시선, 근전도(EMG), 스테레오 영상, 로봇 관절 상태를 포함한 7개 센서 스트림에서 동기화된 다중모달 데이터를 제공한다.
  • 눈의 시선은 물리적 상호작용 이전에 작업과 관련된 물체(예: 음식 조각)를 일관되게 향하고 있었으며, 이는 의도 추론에 있어 예측가능성을 확인한다.
  • 조작기 제어를 위한 전 forearm 근전도(EMG) 신호는 조작기 입력과 관련된 식별 가능한 패턴을 보였으며, 이는 의도 모델링에 활용될 수 있음을 뒷받침한다.
  • 데이터셋은 직접 원격 제어(제어 모드 0)와 공유 자율성(제어 모드 3) 조건을 모두 포함하여 로봇의 자율성에 대한 비교 연구를 가능하게 한다.
  • 조작기 입력은 120 Hz로 재샘플링되었고 타임스탬프는 Unix 에포크 기준으로 동기화되어 고정밀도 시간 해상도를 확보하였다.
  • 계산 부하로 인한 일부 데이터 손실이 있었음에도 불구하고, 데이터셋은 HARP Lab 웹사이트 및 GitHub 리포지토리를 통해 버전 관리된 방식으로 공개되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.