[论文解读] NIKI: Neural Inverse Kinematics with Invertible Neural Networks for 3D Human Pose and Shape Estimation
NIKI 提出了一种基于可逆神经网络的新型逆运动学框架,通过联合建模正向与逆向运动学,实现了对遮挡的鲁棒性以及像素对齐的3D人体姿态与形状精度。通过采用双射误差嵌入将姿态误差与合理的人体姿态流形解耦,并施加零误差边界条件,NIKI 在标准基准和遮挡密集的基准上均优于当前最先进方法,实现了精度与鲁棒性的SOTA表现。
With the progress of 3D human pose and shape estimation, state-of-the-art methods can either be robust to occlusions or obtain pixel-aligned accuracy in non-occlusion cases. However, they cannot obtain robustness and mesh-image alignment at the same time. In this work, we present NIKI (Neural Inverse Kinematics with Invertible Neural Network), which models bi-directional errors to improve the robustness to occlusions and obtain pixel-aligned accuracy. NIKI can learn from both the forward and inverse processes with invertible networks. In the inverse process, the model separates the error from the plausible 3D pose manifold for a robust 3D human pose estimation. In the forward process, we enforce the zero-error boundary conditions to improve the sensitivity to reliable joint positions for better mesh-image alignment. Furthermore, NIKI emulates the analytical inverse kinematics algorithms with the twist-and-swing decomposition for better interpretability. Experiments on standard and occlusion-specific benchmarks demonstrate the effectiveness of NIKI, where we exhibit robust and well-aligned results simultaneously. Code is available at https://github.com/Jeff-sjtu/NIKI
研究动机与目标
- 解决3D人体姿态与形状估计中网格-图像对齐与遮挡鲁棒性之间的权衡问题。
- 克服现有像素对齐方法在遮挡下失效,以及直接回归方法缺乏对齐精度的局限性。
- 开发一种基于可逆神经网络的双向学习框架,同时建模正向与逆向运动学。
- 通过旋转向量与摆动分解模拟解析逆运动学,提升可解释性。
- 在无遮挡与高度遮挡场景下均实现SOTA性能。
提出的方法
- 使用可逆神经网络(INNs)学习关节位置与3D关节旋转及潜在误差嵌入联合空间之间的双射映射。
- 在逆向过程中,通过监督潜在误差的边缘分布,将误差与合理的人体姿态流形分离,提升对噪声或遮挡关节检测的鲁棒性。
- 在正向过程中,施加零误差边界条件,确保预测的旋转能准确解释可靠的关节位置,从而提升网格-图像对齐精度。
- 通过两个连续的可逆网络将全身旋转分解为旋转向量与摆动分量,提升可解释性与建模保真度。
- 在正向与逆向方向上联合训练INN,利用正向运动学的确定性特性以稳定学习过程。
- 在推理过程中引入热力图条件以进一步优化关键点监督,尽管在严重遮挡下性能略有下降。
实验结果
研究问题
- RQ1统一框架能否在3D人体姿态与形状估计中同时实现高像素对齐精度与遮挡鲁棒性?
- RQ2如何利用可逆神经网络建模逆运动学中的双向误差传播以提升鲁棒性?
- RQ3在正向过程中施加零误差边界条件在不牺牲鲁棒性的前提下,能在多大程度上提升网格-图像对齐?
- RQ4与端到端旋转预测相比,旋转向量与摆动分解是否能提升神经网络逆运动学的可解释性与性能?
- RQ5该方法在不同遮挡程度下,特别是在极端情况下的表现如何?
主要发现
- 在标准3DPW基准上,NIKI实现71.3 mm MPJPE与40.6 mm PA-MPJPE,优于先前SOTA方法。
- 在具有极端遮挡的挑战性3DPW-XOCC数据集上,NIKI实现110.7 mm MPJPE与60.5 mm PA-MPJPE,展现出强大鲁棒性。
- 在3DPW-XOCC上,NIKI将网格碰撞率从2.6%降低至1.0%,表明重建结果更具合理性与真实性。
- 在中等遮挡水平(20–30%)下,NIKI相比PARE实现13.3 mm MPJPE的改进,凸显其在真实遮挡场景中的有效性。
- 在低遮挡水平(0–10%)下,性能提升6.5 mm MPJPE;在高遮挡水平(70–80%)下仍保持10.2 mm的改进,证实其在不同遮挡强度下的一致性能。
- 尽管引入了热力图条件,NIKI在3DPW-XOCC上的性能略有下降,表明热力图监督在严重遮挡下可靠性降低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。