[论文解读] Pre-train, Self-train, Distill: A simple recipe for Supersizing 3D Reconstruction
本文提出一种通过三阶段训练流程(在合成3D数据上预训练、在包含前景掩码的多样化野外图像集合上自训练、将知识蒸馏到单一高容量模型中)统一训练的3D重建模型。该方法在150多个物体类别上实现了最先进性能,并展现出对未见类别的强大零样本泛化能力,随着训练类别数量的增加,重建质量显著提升。
Our work learns a unified model for single-view 3D reconstruction of objects from hundreds of semantic categories. As a scalable alternative to direct 3D supervision, our work relies on segmented image collections for learning 3D of generic categories. Unlike prior works that use similar supervision but learn independent category-specific models from scratch, our approach of learning a unified model simplifies the training process while also allowing the model to benefit from the common structure across categories. Using image collections from standard recognition datasets, we show that our approach allows learning 3D inference for over 150 object categories. We evaluate using two datasets and qualitatively and quantitatively show that our unified reconstruction approach improves over prior category-specific reconstruction baselines. Our final 3D reconstruction model is also capable of zero-shot inference on images from unseen object categories and we empirically show that increasing the number of training categories improves the reconstruction quality.
研究动机与目标
- 通过在数百个物体类别上学习统一模型,解决单视角3D重建中的可扩展性与泛化差距问题。
- 克服类别特定模型缺乏共享3D先验且需大量正则化的局限性。
- 仅使用前景掩码的弱监督,实现对未见物体类别的零样本3D重建。
- 证明增加训练类别数量可提升泛化能力与重建质量。
提出的方法
- 在合成多视角渲染数据上预训练3D重建模型,以学习强健的3D先验。
- 仅使用前景掩码标注作为监督,在野外图像集合上对类别特定模型进行自训练。
- 使用知识蒸馏将类别特定模型的知识迁移至统一的高容量3D重建网络。
- 利用类别间的共享结构先验,提升泛化能力并减少对对抗性或可变形先验的依赖。
- 端到端训练统一模型,以实现在未见类别上的零样本推理。
- 使用迭代最近点(ICP)对齐预测结果与真实值,并采用Chamfer距离和IoU指标进行评估。
实验结果
研究问题
- RQ1仅使用2D掩码监督,单一统一的3D重建模型能否在数百个多样化物体类别上实现泛化?
- RQ2在合成数据上进行预训练是否能提升泛化能力并降低弱监督3D学习中的不稳定性?
- RQ3自训练与知识蒸馏能否在无需额外正则化的情况下,有效将类别特定模型的知识迁移至统一模型?
- RQ4训练类别数量如何影响对未见类别的零样本泛化能力?
- RQ5统一模型是否能在域内设置与零样本设置下均优于类别特定基线模型?
主要发现
- 统一模型在Pascal3D+和Co3D上达到最先进性能,平均Chamfer距离为0.48,IoU为0.42,优于先前的类别特定基线模型。
- 随着训练类别数量增加,零样本重建性能显著提升:在未见Co3D类别上的平均Chamfer损失从合成基线的0.368降至在125+类别上训练时的0.239。
- 模型可泛化至未见类别,表明跨多样化类别学习的共享3D先验可实现有意义的零样本3D推理。
- 自训练与蒸馏流程实现了鲁棒学习,无需对抗性或可变形先验,提升了稳定性和性能。
- 定性结果表明,对包括椅子、汽车和花瓶等复杂形状在内的多样化物体类别,均能生成高质量3D重建。
- 失败案例包括在遮挡或高度可变物体上表现不佳,表明在处理复杂真实图像变化方面仍存在局限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。