Skip to main content
QUICK REVIEW

[论文解读] Self-supervised Learning of Dense Shape Correspondence

Oshri Halimi, Or Litany|arXiv (Cornell University)|Dec 6, 2018
3D Shape Modeling and Analysis参考文献 5被引用 12
一句话总结

该论文提出了一种全新的完全无监督深度学习方法,用于密集3D形状对应,通过基于测地距离失真最小化的几何准则实现。该方法无需任何标注的真实对应数据,模型学习点级描述子,借助函数映射框架实现高精度、可泛化的对应关系,且在多样化的基准测试中优于监督方法和公理化方法,仅需极少的训练数据。

ABSTRACT

We introduce the first completely unsupervised correspondence learning approach for deformable 3D shapes. Key to our model is the understanding that natural deformations (such as changes in pose) approximately preserve the metric structure of the surface, yielding a natural criterion to drive the learning process toward distortion-minimizing predictions. On this basis, we overcome the need for annotated data and replace it by a purely geometric criterion. The resulting learning model is class-agnostic, and is able to leverage any type of deformable geometric data for the training phase. In contrast to existing supervised approaches which specialize on the class seen at training time, we demonstrate stronger generalization as well as applicability to a variety of challenging settings. We showcase our method on a wide selection of correspondence benchmarks, where we outperform other methods in terms of accuracy, generalization, and efficiency.

研究动机与目标

  • 消除深度学习中对昂贵且稀缺的标注3D形状对应数据的依赖。
  • 开发一种通用的、与类别无关的密集形状对应方法,可在不同形状类别间实现泛化。
  • 实现在极少量数据(包括单对形状)上有效训练,且无需监督。
  • 结合基于模型的几何方法与数据驱动学习的优势,同时无需真实标签。

提出的方法

  • 该方法基于最小化对应点对之间测地距离的失真,使用自监督损失。
  • 通过训练深度神经网络预测点级描述子,当在函数映射框架中使用时,可实现低测地距离失真。
  • 网络仅使用自然形变的几何一致性作为监督信号,实现端到端优化。
  • 该框架兼容任何可变形几何数据,且无需类别特定的预训练。
  • 推理速度极快(低于1秒),并通过PMF方法对结果进行优化以强制满足双射性。
  • 该方法受FMNet启发,但将监督学习替换为完全基于几何的无监督准则。

实验结果

研究问题

  • RQ1是否可以在没有任何标注真实对应关系的情况下学习密集3D形状对应?
  • RQ2深度学习模型是否可以在无需微调或类别特定数据的情况下,跨不同形状类别实现泛化?
  • RQ3是否可以仅用一对形状来训练出一个高精度、可泛化的对应网络?
  • RQ4基于测地距离保持的纯几何损失是否优于监督方法和公理化方法?

主要发现

  • 所提出的无监督方法在泛化任务中优于最先进的监督方法(如FMNet),即使训练迭代次数少于100次。
  • 模型在单对形状上无需真实标签即可实现高精度匹配,训练时间少于15分钟。
  • 在TOSCA基准上,仅在人体形状上训练的模型能很好地泛化到非人体形状,展现出强大的零样本迁移能力。
  • 在Dynamic FAUST数据集上,仅在合成FAUST数据上训练的模型在纹理迁移任务中表现优异,显示出对真实世界动态姿态的强大泛化能力。
  • 该方法的推理时间低于1秒,适用于实时应用。
  • 即使仅使用艺术风格Deadpool模型的3个体态,无监督网络的性能也优于在80个人体形状上训练8小时的监督网络。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。