[论文解读] HandNeRF: Neural Radiance Fields for Animatable Interacting Hands
HandNeRF 提出了一种统一的神经辐射场框架,用于在多样化姿态下对单个或相互作用的手进行高保真、逼真的重建与新视角合成。通过利用基于姿态的形变场将图像映射到规范空间、基于深度的密度优化以及神经特征蒸馏,该方法在 InterHand2.6M 数据集上实现了最先进性能,显著提升了几何精度、纹理质量以及遮挡处理能力。
We propose a novel framework to reconstruct accurate appearance and geometry with neural radiance fields (NeRF) for interacting hands, enabling the rendering of photo-realistic images and videos for gesture animation from arbitrary views. Given multi-view images of a single hand or interacting hands, an off-the-shelf skeleton estimator is first employed to parameterize the hand poses. Then we design a pose-driven deformation field to establish correspondence from those different poses to a shared canonical space, where a pose-disentangled NeRF for one hand is optimized. Such unified modeling efficiently complements the geometry and texture cues in rarely-observed areas for both hands. Meanwhile, we further leverage the pose priors to generate pseudo depth maps as guidance for occlusion-aware density learning. Moreover, a neural feature distillation method is proposed to achieve cross-domain alignment for color optimization. We conduct extensive experiments to verify the merits of our proposed HandNeRF and report a series of state-of-the-art results both qualitatively and quantitatively on the large-scale InterHand2.6M dataset.
研究动机与目标
- 解决在复杂自遮挡和视图覆盖有限条件下,对相互作用手部进行精确、逼真几何与外观重建的挑战。
- 为手势动画与虚拟现实应用提供高保真度的新视角合成与新姿态生成能力。
- 通过姿态感知形变与跨域特征对齐,将单手与相互作用手建模统一于单一 NeRF 基础框架中。
- 克服传统基于网格的模型在捕捉高频细节以及处理手部交互中遮挡区域时的局限性。
- 通过深度监督与来自 2D 教师网络的神经特征蒸馏,提升密度预测与纹理学习的鲁棒性。
提出的方法
- 基于姿态的条件形变场将不同手部姿态的光线映射至共享的规范空间,实现统一的 NeRF 优化。
- 可学习的误差校正网络在标准混合骨骼蒙皮之外增强了非刚性形变建模能力。
- 利用人体姿态先验生成的伪深度图作为监督信号,指导遮挡感知的密度学习,提升几何精度。
- 神经特征蒸馏将预训练 2D 教师网络的特征与 3D 颜色场对齐,提升纹理质量并减少伪影。
- 共享的规范 NeRF 同时建模所有姿态下的几何与外观,通过多视角一致的体素渲染实现新视角合成。
- 通过统一的光线组合与映射策略,该框架支持单手与双相互作用手两种场景。
实验结果
研究问题
- RQ1统一的 NeRF 框架能否在多样化姿态下,有效实现单手与相互作用手的高几何与纹理保真度建模?
- RQ2源自人体姿态先验的深度监督在低可见区域如何改善密度估计与遮挡处理?
- RQ3来自 2D 教师网络的神经特征蒸馏在多大程度上提升了 3D 手部重建的纹理质量并减少了伪影?
- RQ4基于姿态的形变场如何提升在新姿态与新视角下的泛化能力与一致性?
- RQ5在具有挑战性的手部交互场景中,深度监督与特征蒸馏对整体性能的相对贡献如何?
主要发现
- 在完整流程下,HandNeRF 在单手重建中达到 33.0204 的 PSNR,显著优于无蒸馏(32.8421)或无深度监督(30.1057)的消融实验。
- 消融研究显示,深度监督将深度误差(DE)从 0.2106 降低至 0.1840,表明新视角渲染中几何一致性的提升。
- 神经特征蒸馏将 LPIPS 从 0.0488(无蒸馏)降低至 0.0475,证明了感知质量与纹理真实感的改善。
- 基于 TransRenderer 的神经渲染器实现了最低的 LPIPS(0.0479)与 DE(0.1364),表明对细节与深度精度的更好保持。
- 该模型在大规模 InterHand2.6M 基准上,通过定性与定量验证,成功生成了来自任意视角的高保真、逼真手部图像与视频。
- 该框架兼容单手与双相互作用手场景,可在多样化交互姿态下实现一致且鲁棒的性能表现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。