Skip to main content
QUICK REVIEW

[论文解读] 3D-RETR: End-to-End Single and Multi-View 3D Reconstruction with Transformers

Zai Shi, Zhao Meng|arXiv (Cornell University)|Oct 17, 2021
3D Surveying and Cultural Heritage参考文献 50被引用 9
一句话总结

3D-RETR 提出了一种基于 Transformer 的端到端单视角与多视角 3D 重建框架,利用预训练的视觉 Transformer 编码器、用于体素特征生成的 Transformer 解码器,以及用于最终 3D 输出的 CNN 解码器。该方法在显著减少参数量的同时实现了最先进性能。

ABSTRACT

3D reconstruction aims to reconstruct 3D objects from 2D views. Previous works for 3D reconstruction mainly focus on feature matching between views or using CNNs as backbones. Recently, Transformers have been shown effective in multiple applications of computer vision. However, whether or not Transformers can be used for 3D reconstruction is still unclear. In this paper, we fill this gap by proposing 3D-RETR, which is able to perform end-to-end 3D REconstruction with TRansformers. 3D-RETR first uses a pretrained Transformer to extract visual features from 2D input images. 3D-RETR then uses another Transformer Decoder to obtain the voxel features. A CNN Decoder then takes as input the voxel features to obtain the reconstructed objects. 3D-RETR is capable of 3D reconstruction from a single view or multiple views. Experimental results on two datasets show that 3DRETR reaches state-of-the-art performance on 3D reconstruction. Additional ablation study also demonstrates that 3D-DETR benefits from using Transformers.

研究动机与目标

  • 为解决在单视角或多视角 2D 图像上使用 Transformer 进行端到端 3D 重建的空白。
  • 设计一种统一架构,有效整合 Transformer 与 CNN 以实现 3D 重建。
  • 证明在参数量相当的情况下,Transformer 可以在 3D 重建中超越基于 CNN 的主干网络。
  • 在合成数据集和真实世界数据集上验证所提模型的效率与有效性。

提出的方法

  • 使用预训练的视觉 Transformer 编码器从 2D 输入图像中提取视觉特征。
  • 通过独立的 Transformer 解码器,从图像特征生成 3D 体素特征。
  • 通过 CNN 解码器从体素特征重建最终的 3D 物体。
  • 采用 Dice 损失函数进行端到端训练,以优化体素占据预测。
  • 探索了一种使用 VQ-VAE 的两阶段变体,其中离散 token 由 Transformer 解码器自回归生成。
  • 消融研究对比了组件减少的变体,如最小化 Transformer 解码器或替换编码器的设置。

实验结果

研究问题

  • RQ1Transformer 能否在单视角或多视角 2D 图像上有效实现端到端 3D 重建?
  • RQ2所提出的 3D-RETR 架构在性能与参数效率方面相较于基于 CNN 的基线模型表现如何?
  • RQ3各组件——Transformer 编码器、Transformer 解码器与 CNN 解码器——对最终重建质量的贡献分别是什么?
  • RQ4对视觉 Transformer 编码器进行预训练是否能显著提升性能?
  • RQ5相较于使用 VQ-VAE 的两阶段方法,单阶段训练设置在 3D 重建中是否更优?

主要发现

  • 在 ShapeNet 数据集上,3D-RETR 的平均交并比(IoU)达到 0.680,优于以往最先进模型。
  • 尽管仅使用 16300 万参数,3D-RETR-B 的性能仍优于参数量更大的模型,如 Pix2Vox++(9800 万参数)和 Matryoshka(4600 万参数)。
  • 消融研究显示,若移除 Transformer 解码器,IoU 从 0.680 降至 0.667,证明其必要性。
  • 将视觉 Transformer 编码器替换为 ResNet-50 会使性能从 0.680 降至 0.670,表明自注意力特征更具优势。
  • 使用交叉熵损失而非 Dice 损失会导致性能下降,证实 Dice 损失在 3D 重建中为最优选择。
  • 两阶段 VQ-VAE 变体性能劣于单阶段 3D-RETR,表明端到端训练更具有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。