[论文解读] DeepFuse: An IMU-Aware Network for Real-Time 3D Human Pose Estimation from Multi-View Image
DeepFuse 提出了一种两阶段的3D卷积神经网络,通过融合多视角图像和IMU数据实现无需预定义骨骼模型的实时3D人体姿态估计。该方法引入了多通道体素表示、Random Shut数据增强方法以及IMU-bone层实现早期融合,在TotalCapture数据集上达到28.9 mm的平均误差,在Human3.6M数据集上(协议1)达到13.4 mm,性能达到当前最先进水平。
In this paper, we propose a two-stage fully 3D network, namely extbf{DeepFuse}, to estimate human pose in 3D space by fusing body-worn Inertial Measurement Unit (IMU) data and multi-view images deeply. The first stage is designed for pure vision estimation. To preserve data primitiveness of multi-view inputs, the vision stage uses multi-channel volume as data representation and 3D soft-argmax as activation layer. The second one is the IMU refinement stage which introduces an IMU-bone layer to fuse the IMU and vision data earlier at data level. without requiring a given skeleton model a priori, we can achieve a mean joint error of $28.9$mm on TotalCapture dataset and $13.4$mm on Human3.6M dataset under protocol 1, improving the SOTA result by a large margin. Finally, we discuss the effectiveness of a fully 3D network for 3D pose estimation experimentally which may benefit future research.
研究动机与目标
- 为解决融合IMU与多视角图像数据进行3D人体姿态估计的挑战,特别是由于模态差异(四元数 vs. 体素/像素)带来的问题。
- 消除对预定义骨骼模型的依赖,从而实现对未知受试者的泛化能力。
- 通过新型体素表示方法,保留多视角输入的几何特性和原始数据特征。
- 通过一种新型数据增强技术Random Shut,提升模型泛化能力,模拟训练过程中相机遮挡情况。
- 通过在特征层面深度融合IMU与视觉模态,实现实时、高精度的3D姿态估计。
提出的方法
- 将多视角图像表示为多通道体素,以保留相机之间的几何关系和数据原始性。
- 提出Random Shut数据增强方法,在训练过程中随机遮蔽部分相机视角,以模拟部分遮挡情况,提升模型鲁棒性。
- 在视觉分支的最后使用3D soft-argmax层作为激活函数,实现在体素空间中可微的关键点定位。
- 提出IMU-bone层,将IMU四元数数据转换为具有骨骼长度感知能力的特征,实现在共享3D空间中与视觉特征的早期融合。
- 采用两阶段网络结构:第一阶段为仅基于视觉的3D CNN,用于初始3D姿态估计;第二阶段为IMU精修阶段,利用融合后的IMU与视觉特征对预测结果进行优化。
- 在soft-argmax函数中引入温度参数θ,用于控制对高激活体素的关注程度,消融实验表明θ=3为最优选择。
实验结果
研究问题
- RQ1在不依赖预定义骨骼模型的前提下,IMU与多视角图像数据的早期融合是否能提升3D人体姿态估计的准确性?
- RQ2与基于2D的方法相比,多通道体素表示在保留几何信息和提升3D姿态估计性能方面效果如何?
- RQ3Random Shut数据增强技术是否能有效提升模型在部分相机遮挡情况下的泛化能力?
- RQ4在完全3D CNN中,使用3D soft-argmax与hard-argmax或全连接层直接回归相比,对关键点定位的性能影响如何?
- RQ5与2D或混合方法相比,使用体素输入和soft-argmax的全3D CNN是否能实现更快收敛和更优性能?
主要发现
- DeepFuse在TotalCapture数据集上达到28.9 mm的平均关节点误差,在Human3.6M数据集(协议1)上达到13.4 mm,显著优于先前的SOTA方法。
- 与基于2D soft-argmax的基线相比,多通道体素表示在TotalCapture和Human3.6M上分别将误差降低23.6%和28.9%。
- Random Shut显著提升了模型泛化能力,尤其在部分捕获帧上表现更优,消融实验结果验证了这一点。
- 3D soft-argmax层在性能上优于hard-argmax和直接回归(通过全连接层),误差分别为32.7 mm、39.7 mm和45.2 mm。
- 模型收敛迅速——在首个训练周期内即达到SOTA性能,表明3D体素表示能有效捕捉空间结构,避免冗余映射。
- soft-argmax中的最优温度参数θ=3在关注高激活体素与防止过拟合之间实现良好平衡,消融实验中θ取值范围为1至100。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。