[论文解读] HUMBI: A Large Multiview Dataset of Human Body Expressions
HUMBI 是一个大规模多视角数据集,通过 107 台同步的高清摄像机捕捉了 772 位具有自然服饰的多样化人物,实现了高保真度的 3D 网格重建和视角特定的外观建模。该数据集显著提升了 3D 姿态和网格预测性能,并与现有数据集具有互补性,在泛化能力方面表现更优,同时支持逼真的远程存在感建模。
This paper presents a new large multiview dataset called HUMBI for human body expressions with natural clothing. The goal of HUMBI is to facilitate modeling view-specific appearance and geometry of gaze, face, hand, body, and garment from assorted people. 107 synchronized HD cameras are used to capture 772 distinctive subjects across gender, ethnicity, age, and physical condition. With the multiview image streams, we reconstruct high fidelity body expressions using 3D mesh models, which allows representing view-specific appearance using their canonical atlas. We demonstrate that HUMBI is highly effective in learning and reconstructing a complete human model and is complementary to the existing datasets of human body expressions with limited views and subjects such as MPII-Gaze, Multi-PIE, Human3.6M, and Panoptic Studio datasets.
研究动机与目标
- 为解决当前缺乏大规模、多样化且高分辨率的多视角数据集以建模人体表情的视角特定外观与几何结构的问题。
- 通过捕捉受试者、姿态和视角的广泛变化,实现可泛化的逼真人体模型学习。
- 提供一个基准,用于利用密集多视角数据改进 3D 人体重建与识别模型。
- 通过高保真度建模视线、面部、双手、身体及衣物,支持真实感远程存在系统的发展。
提出的方法
- 使用 107 台同步的高清摄像机,涵盖 68 台面向前方的摄像机,捕捉涵盖性别、种族、年龄和身体状况的 772 名受试者。
- 利用 3D 网格模型实现高保真度的 3D 人体表情重建,并通过标准图集映射表示视角特定的外观。
- 利用多视角立体视觉与基于轮廓的形状重建技术,实现人体及衣物几何结构的密集 3D 重建。
- 使用普通的卷积神经网络(CNN)从 HUMBI 学习视角不变的 3D 姿态,利用 MPII 数据集中 2D 关键点的弱监督信号。
- 开展跨数据集评估,以评估与 Human3.6M、MPI-INF-3DHP 和 UP-3D 等现有数据集的泛化能力与互补性。
- 进行摄像机数量消融研究,评估摄像机数量对衣物重建精度与密度的影响。
实验结果
研究问题
- RQ1与现有数据集相比,大规模多视角数据集在受试者多样化和高摄像机密度下,如何提升 3D 人体姿态估计性能?
- RQ2HUMBI 在多大程度上能够提升在其他数据集上训练的 3D 人体网格预测模型的泛化能力?
- RQ3在多视角设置中,实现准确衣物重建所需的最优摄像机数量是多少?
- RQ4在跨数据集评估中,HUMBI 在 3D 手部与人体网格预测任务中的性能与现有数据集相比如何?
- RQ5HUMBI 是否可作为补充数据源,用于提升在有限视角或有限受试者数据集上训练的模型性能?
主要发现
- HUMBI 在 3D 人体关键点预测任务中优于 Human3.6M 和 MPI-INF-3DHP,分别实现 AUC(PCK 曲线下面积)提升 0.023 和 0.064。
- 仅在 HUMBI 上训练的模型在与其他数据集结合后,AUC 分别提升 0.057(Human3.6M)和 0.078(MPI-INF-3DHP)。
- 在 HUMBI 上训练后,于 ObMan 上测试的 3D 手部网格预测误差降低至 3.5 ± 2.4 像素,显示出强大的泛化能力。
- 仅使用 60 台摄像机即可实现接近最优的衣物重建精度与密度,接近 107 台摄像机的性能。
- HUMBI 在单目 3D 人体网格预测中带来显著性能提升,尤其与 UP-3D 结合时,平均误差从 22.7 降低至 12.5 像素。
- 该数据集与现有基准表现出强互补性:将 HUMBI 与其他数据集结合,始终优于单独使用任一数据集。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。