[论文解读] Cross-modal Learning for Image-Guided Point Cloud Shape Completion
本文提出 XMFnet,一种跨模态学习框架,通过在共享潜在空间中使用交叉注意力机制融合图像与点云数据,实现图像引导的3D形状补全。该方法通过避免单视角重建并引入基于可微渲染的弱监督训练方案,实现了最先进性能,优于多个监督基线方法,并与单模态最先进模型相当。
In this paper we explore the recent topic of point cloud completion, guided by an auxiliary image. We show how it is possible to effectively combine the information from the two modalities in a localized latent space, thus avoiding the need for complex point cloud reconstruction methods from single views used by the state-of-the-art. We also investigate a novel weakly-supervised setting where the auxiliary image provides a supervisory signal to the training process by using a differentiable renderer on the completed point cloud to measure fidelity in the image space. Experiments show significant improvements over state-of-the-art supervised methods for both unimodal and multimodal completion. We also show the effectiveness of the weakly-supervised approach which outperforms a number of supervised methods and is competitive with the latest supervised models only exploiting point cloud information.
研究动机与目标
- 解决利用辅助2D图像从部分观测中重建不完整3D点云的挑战。
- 在不依赖单视角重建流程的前提下,实现图像与点云模态的有效融合。
- 探索通过可微渲染提供监督信号的弱监督学习方法。
- 通过利用不同视角的互补信息,提升补全质量。
- 实现与监督单模态或多模态最先进方法相当或更优的性能。
提出的方法
- XMFnet 使用交叉注意力机制,在共享潜在空间中融合图像与点云模态的细粒度、局部化表征。
- 模型采用灵活的解码器以完成不同大小的区域,避免刚性重建约束。
- 使用可微渲染器计算图像空间保真度损失,实现弱监督训练。
- 弱监督损失结合可微Chamfer距离(DCD)与基于渲染的一致性损失,以提升形状质量与收敛性。
- 在单模态变体中,将交叉注意力替换为自注意力,以实现公平比较。
- 应用Mixup数据增强方法,以提升形状完整性和泛化能力。
实验结果
研究问题
- RQ1在潜在空间中基于交叉注意力的融合是否能优于基于单视角重建的融合方法?
- RQ2使用可微渲染的弱监督训练方案能否实现与监督方法相当的性能?
- RQ3辅助图像的视角如何影响补全质量?互补视角是否能提升结果?
- RQ4可微渲染损失与DCD组件对收敛性与形状质量的影响如何?
- RQ5所提出方法在存在噪声与遮挡的真实世界场景中是否具备泛化能力?
主要发现
- 所提出的 XMFnet 模型在 ShapeNetViPC-Dataset 上的监督与弱监督设置下均实现了最先进性能。
- 弱监督方法优于多个监督基线,并与最新单模态监督模型具有竞争力。
- 引入可微渲染损失后,训练收敛速度更快且更平稳,同时显著提升了定性与定量结果。
- DCD 组件显著提升了形状均匀性与整体质量,定性对比显示其在有无 DCD 时的显著差异。
- 加入渲染损失后,CD 从 7.812 降低至 3.743,体现了显著的定量改进。
- 部分图像视角提供的监督效果明显优于其他视角,少数‘差’视角的输出结果与单模态性能相近。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。