Skip to main content
QUICK REVIEW

[论文解读] HARMONIC: A Multimodal Dataset of Assistive Human-Robot Collaboration

Benjamin A. Newman, Reuben M. Aronson|arXiv (Cornell University)|Jul 30, 2018
Cognitive Functions and Memory被引用 7
一句话总结

HARMONIC 是一个大规模的多模态数据集,记录了使用六自由度机器人臂在辅助进餐任务中的人机协作过程。该数据集整合了眼动追踪、肌电图(EMG)、立体视频、操纵杆输入以及机器人运动学数据,支持在辅助机器人领域中开展意图预测、共享自主权和人类心理状态建模的研究。

ABSTRACT

We present the Human And Robot Multimodal Observations of Natural Interactive Collaboration (HARMONIC) data set. This is a large multimodal data set of human interactions with a robotic arm in a shared autonomy setting designed to imitate assistive eating. The data set provides human, robot, and environmental data views of twenty-four different people engaged in an assistive eating task with a 6 degree-of-freedom (DOF) robot arm. From each participant, we recorded video of both eyes, egocentric video from a head-mounted camera, joystick commands, electromyography from the forearm used to operate the joystick, third person stereo video, and the joint positions of the 6 DOF robot arm. Also included are several features that come as a direct result of these recordings, such as eye gaze projected onto the egocentric video, body pose, hand pose, and facial keypoints. These data streams were collected specifically because they have been shown to be closely related to human mental states and intention. This data set could be of interest to researchers studying intention prediction, human mental state modeling, and shared autonomy. Data streams are provided in a variety of formats such as video and human-readable CSV and YAML files.

研究动机与目标

  • 创建一个全面的、多模态的人机交互数据集,用于共享自主权场景,以支持辅助机器人领域的研究。
  • 捕捉非语言行为线索(如眼动追踪、肌电图(EMG)和姿势)与任务执行过程中人类意图和心理状态的相关性。
  • 通过提供来自多个传感器的同步、高保真数据流,支持意图推断与人机协同的研究。
  • 通过包含直接遥操作和机器人辅助控制两种条件,支持共享自主权的研究。
  • 提供一个标准化的、公开可用的数据集,用于基准测试人类行为模型、意图预测和自适应机器人控制模型。

提出的方法

  • 收集了24名参与者使用六自由度Kinova Mico机器人臂执行辅助进餐任务时的同步数据。
  • 记录了第一视角RGB视频、双目眼动追踪(红外)、第三人称立体视频,以及通过二维操纵杆(支持手动模式切换)的输入数据。
  • 采集了控制操纵杆的前臂肌电图(EMG)信号以及机器人臂的关节位置。
  • 将眼动追踪数据投影到第一视角视频上,并利用计算机视觉流程提取了身体姿态、手部姿态和面部关键点。
  • 使用Stereolabs ZED设备进行立体视频采集,并对所有模态实现了时间戳同步。
  • 以H.264视频、CSV、YAML和NumPy数组等多种格式存储数据,以确保可访问性和可复现性。

实验结果

研究问题

  • RQ1在辅助人机协作过程中,眼动模式与任务相关物体交互之间存在何种关联?
  • RQ2肌电图(EMG)信号和操纵杆输入在多大程度上能够预测遥操作机器人操作中的用户意图?
  • RQ3不同的控制模式(直接遥操作与共享自主权)在多大程度上影响人机协同与行为动态?
  • RQ4多模态信号(眼动追踪、肌电图(EMG)、姿势)能否被有效融合,以推断人类意图并提升机器人辅助效果?
  • RQ5在真实世界辅助任务中,行为信号(如眼动追踪、肌电图(EMG))在不同个体之间的可靠性和一致性如何?

主要发现

  • HARMONIC数据集包含24名参与者,涵盖7个传感器流的同步多模态数据,包括眼动追踪、肌电图(EMG)、立体视频和机器人关节状态。
  • 眼动追踪在与任务相关物体(如食物碎块)发生物理交互之前,始终聚焦于目标物体,证实了其在意图推断中的预测价值。
  • 前臂肌电图(EMG)信号显示出与操纵杆输入相关的可检测模式,支持其在意图建模中的应用。
  • 数据集包含直接遥操作(控制模式0)和共享自主权(控制模式3)两种条件,支持对机器人自主权的对比研究。
  • 数据以高时间保真度采集,操纵杆输入重采样至120 Hz,时间戳与Unix时间戳同步。
  • 尽管由于计算负载导致部分数据丢失,该数据集仍通过HARP实验室网站和GitHub仓库以版本化方式公开发布。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。