[论文解读] Weakly-supervised 3D Shape Completion in the Wild
该论文提出了一种弱监督三维形状补全方法,通过可微分投影和事后学习,从部分点云中重建完整形状,而无需密集监督。该方法在ShapeNet和真实LiDARDatasets上实现了最先进性能,对初始化具有鲁棒性,并在未见类别(如SemanticKITTI中的卡车)上展现出强大的泛化能力,微调后推理的Chamfer距离为0.2942。
3D shape completion for real data is important but challenging, since partial point clouds acquired by real-world sensors are usually sparse, noisy and unaligned. Different from previous methods, we address the problem of learning 3D complete shape from unaligned and real-world partial point clouds. To this end, we propose a weakly-supervised method to estimate both 3D canonical shape and 6-DoF pose for alignment, given multiple partial observations associated with the same instance. The network jointly optimizes canonical shapes and poses with multi-view geometry constraints during training, and can infer the complete shape given a single partial point cloud. Moreover, learned pose estimation can facilitate partial point cloud registration. Experiments on both synthetic and real data show that it is feasible and promising to learn 3D shape completion through large-scale data without shape and pose supervision.
研究动机与目标
- 解决仅有部分点云而无密集真实标签监督的弱监督三维形状补全挑战。
- 通过引入形状-投影-匹配-观测损失项和事后学习目标,提升形状补全和部分点云配准性能。
- 通过推理时微调实现对野外新类别的零样本泛化,例如SemanticKITTI中的停靠卡车。
- 与先前的弱监督方法(如DPC)相比,降低对随机初始化的敏感性。
- 在合成数据(ShapeNet)和真实世界LiDAR数据集(包括3D车辆和SemanticKITTI基准)上验证该方法。
提出的方法
- 该方法引入形状-投影-匹配-观测损失,强制预测形状、其二维投影与观测到的部分点云之间保持一致性。
- 采用事后学习目标以稳定训练并降低对局部极小值的脆弱性,从而改善收敛性和性能。
- 利用可微分投影层将三维形状映射到二维视图,实现从部分观测中端到端优化形状补全。
- 对于汽车等对称物体,该方法变体在二维投影上优化Chamfer距离,以缓解对称性带来的姿态歧义。
- 在新类别(如SemanticKITTI中的卡车)上推理时进行微调,使模型能够以极少监督适应未见数据。
- 学习到的形状特征的t-SNE可视化结果表明,模型能捕获有意义且语义相似的表示。
实验结果
研究问题
- RQ1与仅使用观测匹配形状相比,所提出的形状-投影-匹配-观测损失在提升形状补全性能方面有多有效?
- RQ2事后学习目标是否能显著减少弱监督三维形状补全中的训练不稳定性并改善收敛性?
- RQ3在推理时微调的情况下,模型对野外新类别(如SemanticKITTI中的卡车)的泛化能力在多大程度上得以实现?
- RQ4训练期间输入视图数量如何影响模型在三维形状补全和配准任务上的性能?
- RQ5与先前的弱监督基线方法(如DPC)相比,该方法对随机初始化的敏感性如何?
主要发现
- 在ShapeNet上,完整方法实现Chamfer距离1.65(×100),精确率0.77,覆盖率0.88,优于缺少形状-投影-匹配-观测项或事后学习损失的消融实验。
- 消融研究显示,若移除形状-投影-匹配-观测项,Chamfer距离增加且覆盖率下降,证实该损失项在对齐预测与观测中的关键作用。
- 该方法显著降低了在不同随机初始化下的性能方差,ShapeNet上Chamfer距离的标准差为0.03,远低于DPC的0.81。
- 在3D车辆数据集上,每实例使用4个视图在性能与计算开销之间取得最佳平衡,Chamfer距离为0.261。
- 在SemanticKITTI卡车上微调后,方法实现Chamfer距离0.2942,姿态准确率86.74%,中位角度差2.08°,展现出强大的零样本泛化能力。
- t-SNE可视化结果表明,学习到的形状特征聚类合理,语义相似的形状具有相近的特征表示。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。