Skip to main content
QUICK REVIEW

[论文解读] Lightweight Multi-View 3D Pose Estimation through Camera-Disentangled Representation

Edoardo Remelli, Shangchen Han|arXiv (Cornell University)|Apr 5, 2020
Human Pose and Action Recognition参考文献 33被引用 9
一句话总结

本文提出了一种轻量级、实时的多视角3D人体姿态估计方法,采用相机解耦表示学习。通过将2D特征融合至相机无关的潜在空间,并应用GPU优化的可微分DLT层,该方法在H36M和Total Capture数据集上实现了最先进(SOTA)的精度,推理速度达约25 FPS,优于计算量庞大的体素基线方法,且无需额外数据。

ABSTRACT

We present a lightweight solution to recover 3D pose from multi-view images captured with spatially calibrated cameras. Building upon recent advances in interpretable representation learning, we exploit 3D geometry to fuse input images into a unified latent representation of pose, which is disentangled from camera view-points. This allows us to reason effectively about 3D pose across different views without using compute-intensive volumetric grids. Our architecture then conditions the learned representation on camera projection operators to produce accurate per-view 2d detections, that can be simply lifted to 3D via a differentiable Direct Linear Transform (DLT) layer. In order to do it efficiently, we propose a novel implementation of DLT that is orders of magnitude faster on GPU architectures than standard SVD-based triangulation methods. We evaluate our approach on two large-scale human pose datasets (H36M and Total Capture): our method outperforms or performs comparably to the state-of-the-art volumetric methods, while, unlike them, yielding real-time performance.

研究动机与目标

  • 解决现有体素多视角3D姿态估计方法依赖3D卷积网络所导致的计算效率低下问题。
  • 通过避免昂贵的3D网格运算,实现在VR头显等低算力设备上的实时3D姿态估计。
  • 通过解耦的、规范化的特征融合机制,提升多视角下2D关键点检测的准确性。
  • 开发一种GPU优化的DLT实现,加速三角测量过程而不损失精度。
  • 在推理阶段实现对未见相机视角的良好泛化能力,提升鲁棒性与灵活性。

提出的方法

  • 使用共享主干网络将每张输入图像编码为潜在表示,通过特征变换层实现与相机视角的解耦。
  • 利用1D卷积将相机无关的特征融合为规范坐标系下的统一3D姿态表示。
  • 通过条件化编码的相机投影矩阵,使用浅层2D CNN为每个视角解码2D关节位置。
  • 通过可微分的直接线性变换(DLT)层将2D检测结果提升至3D,支持端到端训练。
  • 提出一种新型GPU加速DLT,采用移位迭代替代SVD,实现相较于标准SVD方法约100倍的速度提升。
  • 通过反向传播穿过DLT层,端到端训练整个网络,以3D MPJPE损失为目标进行优化。

实验结果

研究问题

  • RQ1多视角3D姿态估计能否在不依赖计算成本高昂的3D体素网络的前提下实现实时推理?
  • RQ2相机解耦的潜在表示是否能相比独立单目估计,显著提升多视角下2D关键点检测的准确性?
  • RQ3在深度学习流水线中,可微分且高效的DLT实现能否在不损失精度的前提下替代基于SVD的三角测量?
  • RQ4该方法在训练阶段未见的相机视角下泛化能力如何?
  • RQ5所提方法能否在保持极小模型尺寸与极低推理延迟的同时,实现最先进精度?

主要发现

  • 在TotalCapture数据集上,所提出的规范融合(Canonical Fusion)方法相比简单特征融合提升了约10%的2D检测精度,相比单目基线提升了约18%。
  • 通过在DLT层实现端到端训练,方法在3D MPJPE上相比不可微分版本提升了7%,证明了联合优化的优势。
  • 在Human3.6M数据集上,当使用额外2D标注时,该方法在MPJPE上相比Iskakov等人[17]的最先进体素方法提升了约20%。
  • 该模型在单张GPU上运行速度约为25 FPS(40ms推理时间),相比Iskakov等人[17]的体素方法快约57倍,相比其代数三角测量基线快约50倍。
  • 该模型在精度上与SOTA体素方法(Iskakov等人[17])相当,但模型尺寸显著更小(251MB vs. 643MB),且速度快得多。
  • 该方法在未见相机视角下表现出良好的泛化能力,展现出超越训练设置的鲁棒性与灵活性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。