Skip to main content
QUICK REVIEW

[论文解读] Multimodal Shape Completion via IMLE

Himanshu Arora, S. Mishra|arXiv (Cornell University)|Jun 30, 2021
3D Shape Modeling and Analysis参考文献 1被引用 6
一句话总结

该论文提出了一种新颖的多模态形状补全方法,采用隐式最大似然估计(IMLE)从部分点云生成多样化、结构多样的完整3D形状。通过避免生成对抗网络(GAN)固有的模式崩溃问题,该方法在多样性与几何保真度方面优于先前方法,在总互异度指标上达到最先进性能,且在单向豪斯多夫距离指标上表现具有竞争力。

ABSTRACT

Shape completion is the problem of completing partial input shapes such as partial scans. This problem finds important applications in computer vision and robotics due to issues such as occlusion or sparsity in real-world data. However, most of the existing research related to shape completion has been focused on completing shapes by learning a one-to-one mapping which limits the diversity and creativity of the produced results. We propose a novel multimodal shape completion technique that is effectively able to learn a one-to-many mapping and generates diverse complete shapes. Our approach is based on the conditional Implicit MaximumLikelihood Estimation (IMLE) technique wherein we condition our inputs on partial 3D point clouds. We extensively evaluate our approach by comparing it to various baselines both quantitatively and qualitatively. We show that our method is superior to alternatives in terms of completeness and diversity of shapes.

研究动机与目标

  • 为解决形状补全问题的病态性,通过生成多个合理补全结果而非单一输出来应对。
  • 克服条件GAN中固有的模式崩溃问题,从而提升生成形状的结构多样性。
  • 利用IMLE建立形状补全的一对多映射,实现多样化且具备几何感知能力的补全结果。
  • 在未见的不完整形状上实现良好泛化,包括整体部件缺失的情况,且无需部件级别的监督。
  • 在训练和推理成本低于条件GAN的前提下,实现高性能表现。

提出的方法

  • 该方法采用条件IMLE训练生成器,将来自部分点云和随机噪声的潜在码映射为完整形状。
  • 自编码器对部分输入进行编码并重建完整形状,生成器通过可微采样最小化隐式似然目标。
  • 解码器从潜在码重建生成的形状,模型通过基于梯度的更新进行优化,无需判别器。
  • 生成器使用隐式似然目标的可微近似进行训练,实现端到端训练,且参数量少于GAN。
  • 编码器和解码器采用带批量归一化的1D卷积层,生成器采用全连接层。
  • 推理阶段,每张部分形状生成10个样本,以评估多样性和完整性。

实验结果

研究问题

  • RQ1基于IMLE的训练能否有效从单个部分点云输入生成结构多样的3D形状?
  • RQ2与条件GAN相比,该方法是否能更好地避免模式崩溃,从而生成更多样化的补全结果?
  • RQ3该模型能否在无部件级别监督的情况下,泛化到整体部件缺失的不完整形状?
  • RQ4在多样性(总互异度)和形状保真度(单向豪斯多夫距离)方面,该方法的定量表现如何?
  • RQ5与条件GAN相比,该方法在训练和推理效率方面有何提升?

主要发现

  • 该方法在噪声输入下的总互异度达到2.71 × 10⁻²,表明具有出色的结构多样性。
  • 该方法在噪声输入下的单向豪斯多夫距离为8.84 × 10⁻²,显示出对输入噪声的鲁棒性。
  • 该模型在未见数据集(如RobustPointSet)上泛化良好,能成功补全包含复杂伪影(如噪声和旋转)的形状。
  • 该方法训练时间更短(13.5小时),推理速度更快(每形状2 ms),而条件GAN的训练时间长达每秒20 ms。
  • 尽管缺乏部件级别监督,该模型仍能学习在正确位置生成缺失部件,并保持准确的几何形状与对称性。
  • 即使在全局注入噪声的情况下,该模型仍能生成结构多样的补全结果,表明缺失部件区域存在局部变化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。