Skip to main content
QUICK REVIEW

[论文解读] To The Point: Correspondence-driven monocular 3D category reconstruction

Filippos Kokkinos, Iasonas Kokkinos|arXiv (Cornell University)|Jun 10, 2021
Advanced Vision and Imaging参考文献 49被引用 8
一句话总结

TTP 提出了一种基于对应关系的单目 3D 类别重建方法,该方法用针对 2D-3D 对应关系的可微分、逐样本优化替代了基于 CNN 的相机位姿与形变回归。通过联合优化刚性变换与非刚性形变以最小化重投影误差,TTP 在仅使用单一相机假设且无需几何先验的情况下实现了最先进性能,在 CUB 和 PASCAL3D+ 数据集上优于先前方法。

ABSTRACT

We present To The Point (TTP), a method for reconstructing 3D objects from a single image using 2D to 3D correspondences learned from weak supervision. We recover a 3D shape from a 2D image by first regressing the 2D positions corresponding to the 3D template vertices and then jointly estimating a rigid camera transform and non-rigid template deformation that optimally explain the 2D positions through the 3D shape projection. By relying on 3D-2D correspondences we use a simple per-sample optimization problem to replace CNN-based regression of camera pose and non-rigid deformation and thereby obtain substantially more accurate 3D reconstructions. We treat this optimization as a differentiable layer and train the whole system in an end-to-end manner. We report systematic quantitative improvements on multiple categories and provide qualitative results comprising diverse shape, pose and texture prediction examples. Project website: https://fkokkinos.github.io/to_the_point/.

研究动机与目标

  • 通过利用 2D-3D 对应关系而非直接回归位姿与形变的 CNN 方法,解决单目 3D 重建的病态问题。
  • 通过在训练和推理过程中均用逐样本优化层替代端到端的 CNN 回归,降低优化复杂度并缓解局部极小值问题。
  • 仅使用弱监督(掩码标注和可选的关键点标注)实现高保真 3D 重建,无需强监督或预设的几何先验。
  • 证明预测对应关系比直接回归位姿与形变更有效,从而提升准确性和鲁棒性。

提出的方法

  • 该方法使用 CNN 回归对应于 3D 模plate 顶点的 2D 图像坐标,将其视为一个可微分层。
  • 对每张图像,求解一个逐样本优化问题,联合估计最小化预测 3D 顶点与其 2D 投影之间重投影误差的刚性相机变换与非刚性形变。
  • 该优化过程是可微分的,并集成到训练流程中,支持通过整个系统进行端到端反向传播。
  • 该方法使用自监督损失,包括像素级重投影损失、可见性一致性以及对数据增强的等变性。
  • 采用学习到的基函数表示非刚性形变,消融实验表明随着基函数大小增加,性能持续提升。
  • 系统在有无关键点监督的情况下均进行了训练,表明即使在无关键点设置下也表现出强大性能。

实验结果

研究问题

  • RQ1能否通过直接最小化重投影误差的可微分优化层,在单目 3D 重建中超越基于 CNN 的位姿与形变回归方法?
  • RQ2消除如预设相机视角或对称性等几何先验是否能提升泛化能力并减少对多假设采样机制的依赖?
  • RQ3弱监督(掩码标注和可选关键点)在无需强监督的情况下,能在多大程度上实现高质量的 3D 重建?
  • RQ4单次优化步骤是否足以实现精确的 3D 网格恢复,从而支持增强现实等实时或交互式应用?
  • RQ5在关键点监督与无关键点设置下,基于对应关系的优化方法与最先进方法相比表现如何?

主要发现

  • 在 PASCAL3D+ 数据集上,TTP 使用 64 个基函数组件和关键点监督,实现了 0.775 的 3D mIoU,优于包括 UCMR 和 CMR 在内的先前方法。
  • 即使在无关键点监督的情况下,TTP 在 PASCAL3D+ 上仍达到 0.752 的 mIoU,显著优于无关键点的竞争对手 CSM(0.512 mIoU)。
  • 在 CUB 数据集上,TTP 在关键点监督下实现了 93.6 的 PCK 分数,领先于次佳方法超过 10 分。
  • 消融实验表明,若移除像素级重投影损失,无关键点设置下的性能将下降至 0.667 mIoU,表明其在监督中起着关键作用。
  • 该方法在仅使用单一相机假设的情况下实现了最先进性能,避免了先前工作中所需的多假设位姿与复杂的选择机制。
  • 定性结果表明,TTP 在纹理、形变与位姿估计方面优于 CMR 和 UCMR,尤其在捕捉细节与复杂形状方面表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。