[论文解读] A Dataset of Relighted 3D Interacting Hands
本文提出了 Re:InterHand,一个大规模的、经过光照重制的三维交互手部数据集,结合了逼真的、多样的图像外观与精确的三维真实姿态。通过将最先进的手部光照重制网络应用于多相机工作室中精确追踪的三维手部姿态,该数据集在保持强三维姿态精度的同时,实现了高度逼真和多样的外观表现,在逼真度和标注质量方面均优于现有数据集。
The two-hand interaction is one of the most challenging signals to analyze due to the self-similarity, complicated articulations, and occlusions of hands. Although several datasets have been proposed for the two-hand interaction analysis, all of them do not achieve 1) diverse and realistic image appearances and 2) diverse and large-scale groundtruth (GT) 3D poses at the same time. In this work, we propose Re:InterHand, a dataset of relighted 3D interacting hands that achieve the two goals. To this end, we employ a state-of-the-art hand relighting network with our accurately tracked two-hand 3D poses. We compare our Re:InterHand with existing 3D interacting hands datasets and show the benefit of it. Our Re:InterHand is available in https://mks0601.github.io/ReInterHand/.
研究动机与目标
- 解决现有数据集中同时提供多样化、逼真的图像外观与大规模、精确三维手部姿态标注的不足,尤其针对双手交互场景。
- 通过结合各方法的优势,克服现有数据集的局限性——实验室环境数据集(外观单调)、自然场景数据集(规模和精度有限)、合成数据集(光照不一致)——实现更优的综合性能。
- 通过使用学习到的光照重制网络生成具有逼真光照和反光效果的图像,提升真实世界(野外)场景下三维手部姿态估计的鲁棒性。
- 为在真实视觉条件下(包括第一人称和第三人称视角)评估三维交互手部重建方法提供基准。
- 通过提供大规模、高质量的数据集,涵盖多样的手部姿态和逼真的渲染效果,推动三维手部姿态估计研究的发展。
提出的方法
- 利用配备100台同步相机的多相机工作室系统,捕捉高保真的三维手部姿态,确保获得精确的三维关节和MANO网格标注。
- 将基于单手数据训练的最先进手部光照重制网络应用于三维手部网格,通过高分辨率环境贴图实现逼真的光照效果。
- 通过渲染不同姿态、光照和背景的三维手部网格,生成150万张图像,同时保持逼真的肤色和反光效果。
- 使用环境贴图模拟真实世界的光照变化,增强外观多样性,同时确保手部几何结构与光照之间的一致性。
- 应用AdaIN等后处理技术改善前景手部与背景之间的色彩协调性,但由于反光不准确,效果有限。
- 通过排除可识别信息并使用知情同意书,确保数据集质量,保护隐私的同时维持数据实用性。
实验结果
研究问题
- RQ1一个三维手部数据集能否同时结合逼真、多样的图像外观与大规模、精确的三维姿态标注,从而提升在真实世界场景下的泛化能力?
- RQ2使用学习到的网络对三维手部网格进行光照重制,对三维手部姿态估计模型在真实世界和野外数据上的性能有何影响?
- RQ3与现有数据集相比,该数据集在逼真度、姿态多样性及三维精度方面提升的幅度如何?
- RQ4与现有基准相比,在Re:InterHand上进行训练是否能提升模型在第一人称和第三人称视角下的泛化能力?
- RQ5当前光照重制网络在复杂、交互的双手场景中存在哪些局限性?
主要发现
- 在微调后,Re:InterHand在自身测试集上的RRVE达到20.07,显著优于基线模型InterWild(28.89 RRVE),尤其在第一人称视角下表现更优。
- 光照重制阶段将HIC(真实世界数据集)上的误差从67.11降至52.91 RRVE,表明模型在自然图像外观下的泛化能力显著提升。
- 在Re:InterHand上微调后,InterHand2.6M上的误差降低2.4%(从19.74降至19.40 RRVE),表明即使在实验室数据上,模型也具备更强的鲁棒性。
- 光照重制过程成功保留了肤色和逼真的光照效果,优于简单拼接方法,后者在前景与背景之间存在光照不一致的问题。
- 尽管存在挑战,光照重制网络在双手交互场景中仍表现出合理的泛化能力,但因从单手到双手数据的领域偏移,偶尔会出现伪影。
- 该数据集使第三视角和第一人称视角的基准测试达到最先进性能,验证了其在真实世界三维手部姿态估计中的实用价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。