Skip to main content
QUICK REVIEW

[论文解读] HA-ViD: A Human Assembly Video Dataset for Comprehensive Assembly Knowledge Understanding

Hao Zheng, Regina Lee|arXiv (Cornell University)|Jul 9, 2023
Robot Manipulation and Learning被引用 6
一句话总结

HA-ViD 引入了首个面向真实工业装配任务的多视角、多模态视频数据集,采用通用装配盒(GAB)进行采集,涵盖人类与机器人共享的细粒度标注,涉及主体、动作动词、被操作物体、目标物体及工具。该数据集支持基础视频理解任务的基准测试,并推动机器人学、人机协作及质量保证领域的综合知识提取。数据集包含 3,222 段视频、150 万帧图像、96,000 个时序标签和 200 万个空间标签,遵循 CC BY-NC 4.0 许可。

ABSTRACT

Understanding comprehensive assembly knowledge from videos is critical for futuristic ultra-intelligent industry. To enable technological breakthrough, we present HA-ViD - the first human assembly video dataset that features representative industrial assembly scenarios, natural procedural knowledge acquisition process, and consistent human-robot shared annotations. Specifically, HA-ViD captures diverse collaboration patterns of real-world assembly, natural human behaviors and learning progression during assembly, and granulate action annotations to subject, action verb, manipulated object, target object, and tool. We provide 3222 multi-view, multi-modality videos (each video contains one assembly task), 1.5M frames, 96K temporal labels and 2M spatial labels. We benchmark four foundational video understanding tasks: action recognition, action segmentation, object detection and multi-object tracking. Importantly, we analyze their performance for comprehending knowledge in assembly progress, process efficiency, task collaboration, skill parameters and human intention. Details of HA-ViD is available at: https://iai-hrc.github.io/ha-vid.

研究动机与目标

  • 为解决缺乏全面、真实世界装配视频数据集的问题,这些数据集应同时支持人类与机器人对程序性知识的理解。
  • 捕捉复杂装配任务中自然的程序性学习行为,例如效率差异、替代路径、暂停及错误。
  • 建立一致的人机共享标注协议,以捕捉主体、动作动词、被操作物体、目标物体及工具的交互关系。
  • 支持在工业场景中对基础视频理解任务(如动作识别、动作分割、目标检测和多目标跟踪)进行基准测试。
  • 通过细粒度、组合式标注,支持机器人技能学习、人机协作及质量保证等下游应用。

提出的方法

  • 采用三阶段渐进式装配设置,使用通用装配盒(GAB)——一个 250×250×250 毫米的工业装配任务,包含 35 个零件和 4 种标准工具进行数据采集。
  • 在三个不同工位上,针对 3,222 次独立装配任务,采集了多视角、多模态视频,涵盖不同的任务优先级与协作需求。
  • 采用分层的人机共享装配分类法(HR-SAT),对动作进行细粒度标注:主体、动作动词、被操作物体、目标物体及工具。
  • 明确标注双手协作状态,并对人类暂停与错误行为进行标记,以捕捉程序性学习的动力学特征。
  • 数据预处理包括面部模糊化以保护隐私,以及 I3D 特征提取以支持动作分割的基准测试。
  • 数据集以 CC BY-NC 4.0 许可公开发布,支持未来更新、错误报告与版本管理。

实验结果

研究问题

  • RQ1基础视频理解模型在真实工业环境中识别与分割复杂装配动作方面的表现如何?
  • RQ2动作识别与分割模型在多大程度上能够捕捉程序性知识,包括效率差异、替代路径以及装配过程中的错误?
  • RQ3多目标跟踪与目标检测模型能否在复杂、动态的装配场景中准确地定位并跟踪所有相关零件与工具?
  • RQ4所提出的“人机共享”标注协议在支持机器人与工业应用中实现一致、可解释且可重用的知识提取方面效果如何?
  • RQ5细粒度、组合式标注(主体、动词、物体、工具)在提升下游任务(如视觉问题回答或人-物体交互检测)方面发挥何种作用?

主要发现

  • HA-ViD 包含 3,222 段多视角、多模态视频,150 万帧图像,96,000 个时序标签与 200 万个空间标签,是迄今为止最大且最详细的装配任务人类视频数据集。
  • 该数据集通过可观察的行为(如效率差异、替代装配路径、暂停与错误)捕捉了自然的程序性知识获取过程,这些特征在以往数据集中均未出现。
  • 人机共享标注协议实现了对动作组件(主体、动作动词、被操作物体、目标物体、工具)的细粒度标注,为可解释、组合式理解奠定了基础。
  • 在四项基础任务(动作识别、动作分割、目标检测、MOT)上的基准测试表明,当前模型可通过更丰富、结构化的标注方案得到显著改进。
  • 该数据集支持高级应用,如组合式动作识别、人-物体交互检测与视觉问题回答,具有在机器人学习与质量保证中应用的潜力。
  • 该数据集以 CC BY-NC 4.0 许可公开发布,并将通过未来更新、错误修正与版本管理持续维护,确保研究社区的长期可用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。