[论文解读] HOI4D: A 4D Egocentric Dataset for Category-Level Human-Object Interaction
HOI4D 提供了首个大规模的4D自指视角人类-物体交互数据集,涵盖4,000段序列中的240万帧RGB-D图像,包含丰富的逐帧标注,包括全景语义分割、3D手部与物体姿态、动作识别,以及重建的场景点云和物体网格。该数据集支持三个关键任务的基准测试——4D动态点云语义分割、类别级物体姿态跟踪,以及细粒度自指视角动作分割,揭示了现有方法面临的显著挑战。
We present HOI4D, a large-scale 4D egocentric dataset with rich annotations, to catalyze the research of category-level human-object interaction. HOI4D consists of 2.4M RGB-D egocentric video frames over 4000 sequences collected by 4 participants interacting with 800 different object instances from 16 categories over 610 different indoor rooms. Frame-wise annotations for panoptic segmentation, motion segmentation, 3D hand pose, category-level object pose and hand action have also been provided, together with reconstructed object meshes and scene point clouds. With HOI4D, we establish three benchmarking tasks to promote category-level HOI from 4D visual signals including semantic segmentation of 4D dynamic point cloud sequences, category-level object pose tracking, and egocentric action segmentation with diverse interaction targets. In-depth analysis shows HOI4D poses great challenges to existing methods and produces great research opportunities.
研究动机与目标
- 解决类别级人类-物体交互领域缺乏大规模真实世界4D自指视角数据集的问题,特别是针对新出现的、未见过的物体类别。
- 克服以往实例级数据集依赖已知CAD模型和合成数据的局限性,这些限制阻碍了真实场景下的应用。
- 推动在真实环境条件下(如遮挡和动态运动)的4D场景理解、类别级物体姿态跟踪与细粒度动作识别研究。
- 为机器人和增强现实应用中的模拟到真实世界迁移提供一个真实、可扩展的基准。
提出的方法
- 从9名参与者在610个不同室内场景中使用自指视角相机执行任务,收集240万帧RGB-D图像,与800个物体实例(涵盖16种类别的刚性与可动物体)交互。
- 采用混合标注流程,结合人工标注与自动化算法,实现全景语义分割、运动分割、3D手部姿态及类别级物体姿态的逐帧标注。
- 为所有序列重建高保真度的3D物体网格与场景点云,以支持3D感知任务。
- 设计三项基准任务:4D动态点云序列的语义分割、手-物体交互的类别级物体姿态跟踪,以及具有多样化目标的自指视角手部动作分割。
- 使用I3D特征进行视频动作分割,并采用逐帧准确率、编辑距离和多个IoU阈值下的F1分数进行评估。
- 在HOI4D上对最先进方法(如PSTNet、P4Transformer、MS-TCN++)进行基准测试,分析性能差距并识别关键失败模式。
实验结果
研究问题
- RQ1在复杂、杂乱的室内自指视角场景中,且存在严重遮挡与传感器噪声的情况下,现有在室外数据上训练的4D语义分割模型能否泛化到此类场景?
- RQ2当前的类别级物体姿态跟踪方法在涉及手部遮挡与动态运动的室内环境中,实际表现如何?
- RQ3现有视频动作分割模型在训练数据为粗粒度时,能多大程度上处理交互场景中的细粒度自指视角人类-物体交互动作?
- RQ4当应用于真实世界自指视角序列中的细粒度、类别级人类-物体交互时,当前模型的关键失败模式是什么?
主要发现
- 最先进室外4D语义分割模型(PSTNet与P4Transformer)在HOI4D上的mIoU分别仅为52.0%与61.2%,且在物体类别上的表现显著低于背景类别(分别为31.4%与44.6% vs. 72.6%与77.7%),表明小尺寸与遮挡带来了严峻挑战。
- 现有视频动作分割模型(MS-TCN、MS-TCN++、Asformer)在HOI4D上性能大幅下降,仅达到46.8%的逐帧准确率,远低于在50Salads数据集上的85.6%,表明其在交互场景中细粒度动作上的泛化能力较差。
- 定性分析显示,模型通常能学习动作顺序,但难以识别当前动作,尤其在动作序列被打乱时,表明动作感知在时间精度上存在不足。
- 该数据集揭示了当前方法在类别级泛化、遮挡与传感器噪声处理方面的关键局限,凸显了对新型4D感知架构的迫切需求。
- HOI4D使此前研究较少的类别级物体姿态跟踪任务得以在真实自指视角数据上进行基准测试,而该任务目前多局限于合成或简单场景设置。
- HOI4D中丰富的标注与逼真的3D重建为机器人学习、增强现实及模拟到真实世界迁移的未来研究奠定了坚实基础。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。