Skip to main content
QUICK REVIEW

[论文解读] Multimodal Semi-Supervised Learning for 3D Objects

Zhi‐Min Chen, Longlong Jing|arXiv (Cornell University)|Oct 22, 2021
3D Shape Modeling and Analysis参考文献 56被引用 10
一句话总结

该论文提出了一种新颖的多模态自监督学习框架,用于3D物体分类与检索,通过利用实例级一致性与多模态对比原型(M2CP)损失,提升了数据效率。通过强制点云、网格和图像之间的一致性表征,并利用类别原型最小化类内特征方差,该方法在ModelNet10和ModelNet40上实现了最先进性能,且仅使用了极少的标注样本。

ABSTRACT

In recent years, semi-supervised learning has been widely explored and shows excellent data efficiency for 2D data. There is an emerging need to improve data efficiency for 3D tasks due to the scarcity of labeled 3D data. This paper explores how the coherence of different modelities of 3D data (e.g. point cloud, image, and mesh) can be used to improve data efficiency for both 3D classification and retrieval tasks. We propose a novel multimodal semi-supervised learning framework by introducing instance-level consistency constraint and a novel multimodal contrastive prototype (M2CP) loss. The instance-level consistency enforces the network to generate consistent representations for multimodal data of the same object regardless of its modality. The M2CP maintains a multimodal prototype for each class and learns features with small intra-class variations by minimizing the feature distance of each object to its prototype while maximizing the distance to the others. Our proposed framework significantly outperforms all the state-of-the-art counterparts for both classification and retrieval tasks by a large margin on the modelNet10 and ModelNet40 datasets.

研究动机与目标

  • 通过提升3D物体学习中的数据效率来应对3D标注数据稀缺的问题。
  • 利用点云、网格与图像之间的跨模态一致性,实现自监督3D表征学习。
  • 开发一个统一框架,联合优化模态间的一致性与类别级特征紧凑性。
  • 在有限监督条件下,超越现有的2D与3D自监督方法,在标准3D基准上表现更优。

提出的方法

  • 引入实例级一致性约束,强制网络对同一3D物体在不同模态(如点云、图像、网格)中生成一致的表征。
  • 提出多模态对比原型(M2CP)损失,为每个类别维护一个共享原型,同时最小化类内特征距离并最大化类间距离。
  • 使用集成MLP聚合未标注样本的多模态特征,生成更可靠的伪标签用于训练。
  • 将M2CP损失与标准交叉熵损失及实例级一致性损失结合,联合优化特征学习与预测一致性。
  • 在输入模态上应用标准数据增强策略(如旋转、噪声)以增强模型在扰动下的鲁棒性与一致性。
  • 端到端训练模型,同时利用标注数据与未标注数据,M2CP损失与一致性损失在缺乏完整监督时引导特征学习。

实验结果

研究问题

  • RQ1点云、网格与图像之间的跨模态一致性是否可有效用于提升自监督3D学习?
  • RQ2在不同模态间强制实施实例级一致性是否能提升3D分类与检索的泛化能力?
  • RQ3多模态对比原型损失是否能减少类内差异并提升3D表征学习中的特征可分性?
  • RQ4在自监督3D学习设置中,可用模态数量如何影响性能?

主要发现

  • 在仅使用2%标注数据的点云模态下,该方法在ModelNet40上达到79.86%的准确率,较Info3D高出近9个百分点。
  • 在10%标注数据下,该方法在图像模态上达到91.61%的准确率,超过FixMatch(89.02%)与Deep Co-training(89.00%)超过2.5个百分点。
  • 仅使用M2CP损失即可使性能相比基线方法提升3.5–4.5%,证明其在减少类内差异方面的有效性。
  • 消融实验证实,交叉熵损失、实例级一致性损失与M2CP损失三者互补且对最优性能至关重要。
  • 随着更多模态的引入,性能持续提升,完整三模态设置在分类与检索任务中均取得最佳结果。
  • 该方法在所有设置下显著优于当前最先进2D与3D自监督方法,证明了多模态一致性在3D表征学习中的价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。