[论文解读] BEHAVE: Dataset and Method for Tracking Human Object Interactions
BEHAVE 提出首个基于多视角 RGBD 相机在自然环境中进行人体-物体交互三维跟踪的数据集与方法。该方法联合跟踪人体(通过 SMPL 模型)、物体(通过模板网格)以及显式的表面接触,通过预测对应关系与无符号距离场实现,在噪声、遮挡和数据不完整的情况下仍保持鲁棒性能,其准确率与效率均优于先前的 IP-Net 和 LoopReg 等方法。
Modelling interactions between humans and objects in natural environments is central to many applications including gaming, virtual and mixed reality, as well as human behavior analysis and human-robot collaboration. This challenging operation scenario requires generalization to vast number of objects, scenes, and human actions. Unfortunately, there exist no such dataset. Moreover, this data needs to be acquired in diverse natural environments, which rules out 4D scanners and marker based capture systems. We present BEHAVE dataset, the first full body human- object interaction dataset with multi-view RGBD frames and corresponding 3D SMPL and object fits along with the annotated contacts between them. We record around 15k frames at 5 locations with 8 subjects performing a wide range of interactions with 20 common objects. We use this data to learn a model that can jointly track humans and objects in natural environments with an easy-to-use portable multi-camera setup. Our key insight is to predict correspondences from the human and the object to a statistical body model to obtain human-object contacts during interactions. Our approach can record and track not just the humans and objects but also their interactions, modeled as surface contacts, in 3D. Our code and data can be found at: http://virtualhumans.mpi-inf.mpg.de/behave
研究动机与目标
- 为自然环境中的人体-物体交互研究填补大规模真实世界数据集的空白。
- 利用低成本、便携的多相机系统,实现对人体、物体及其物理接触的精确三维跟踪。
- 应对交互过程中深度数据噪声大、不完整以及频繁遮挡带来的挑战。
- 开发一种联合拟合框架,利用神经网络预测的对应关系与无符号距离场实现鲁棒配准。
- 公开发布数据集与代码库,以加速人体-物体交互建模领域的研究进展。
提出的方法
- 采用便携式、消费级相机组成的多视角 RGBD 设置,捕获自然环境中的交互动作。
- 使用参数化 SMPL 身体模型表示人体,采用 3D 模板网格表示物体。
- 从 3D 查询点预测至 SMPL 表面的对应关系场,并为人体与物体表面分别预测无符号距离场。
- 引入一种可微的隐式配准损失,仅使用 30k 个查询点即可拟合 SMPL 与物体网格,避免使用计算昂贵的 Marching Cubes 算法。
- 将接触预测作为关键监督信号,以强制实现物理上合理的交互,防止物体漂浮。
- 采用联合优化目标,结合形状补全、对应关系预测与接触预测,提升对缺失数据与噪声的鲁棒性。

实验结果
研究问题
- RQ1基于神经网络的方法能否仅使用多视角 RGBD 输入,在自然环境中联合跟踪人体、物体及其表面接触?
- RQ2如何利用对应关系预测与无符号距离场提升对遮挡与不完整深度数据的鲁棒性?
- RQ3接触预测是否能显著提升跟踪结果中人体-物体交互的物理合理性?
- RQ4在真实世界噪声与数据缺失条件下,该方法与 SOTA 方法(如 IP-Net 与 LoopReg)相比,在准确率与效率方面表现如何?
- RQ5学习得到的可微配准框架在多大程度上可替代传统不可微的重建流水线(如 Marching Cubes)?
主要发现
- 所提方法在准确率与效率上均优于 IP-Net,仅需 30k 个查询点,而 IP-Net 需约 200 万个,且无需使用 Marching Cubes 算法。
- 与 LoopReg 相比,该方法在遮挡与噪声下表现出更强鲁棒性;LoopReg 因仅依赖表面点,在点云不完整时会失效。
- 接触预测对实现物理合理的跟踪至关重要:若无接触预测,物体常出现漂浮或与人体错位现象。
- BEHAVE 数据集包含 15,200 帧多视角 RGBD 序列,涵盖 8 名受试者、20 种物体与 5 个不同场景,是目前规模最大的同类基准。
- 该方法仅依赖便携式、低成本的 RGBD 相机即可实现对人体-物体交互的精确三维跟踪,不再依赖标记点系统或受限制的动作捕捉空间。
- 公开发布的代码与数据集有望推动未来人体-物体交互建模研究,为单视角与多视角跟踪、姿态估计与三维重建提供新的基准。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。