[论文解读] Canonical Capsules: Unsupervised Capsules in Canonical Pose
该论文提出了一种用于3D点云的无监督胶囊架构,通过排列等变注意力将物体分解为胶囊,并利用随机旋转的物体对进行自监督。通过将注意力掩码聚合为语义关键点,强制实现胶囊的不变性/等变性,从而在无需标签或对齐数据集的情况下实现以物体为中心的表征学习,并在3D重建、配准和无监督分类任务中达到最先进性能。
We propose an unsupervised capsule architecture for 3D point clouds. We compute capsule decompositions of objects through permutation-equivariant attention, and self-supervise the process by training with pairs of randomly rotated objects. Our key idea is to aggregate the attention masks into semantic keypoints, and use these to supervise a decomposition that satisfies the capsule invariance/equivariance properties. This not only enables the training of a semantically consistent decomposition, but also allows us to learn a canonicalization operation that enables object-centric reasoning. In doing so, we require neither classification labels nor manually-aligned training datasets to train. Yet, by learning an object-centric representation in an unsupervised manner, our method outperforms the state-of-the-art on 3D point cloud reconstruction, registration, and unsupervised classification. We will release the code and dataset to reproduce our results as soon as the paper is published.
研究动机与目标
- 开发一种无监督的基于胶囊的3D点云架构,无需分类标签或人工标注,学习语义上有意义的以物体为中心的表征。
- 通过输入物体的随机旋转实现自监督,实现胶囊分解满足不变性与等变性特性。
- 学习一种规范化操作,通过将注意力掩码聚合为语义关键点,支持以物体为中心的推理。
- 仅通过无监督训练,在3D重建、配准和无监督分类任务中实现最先进性能。
提出的方法
- 该方法采用排列等变注意力,从3D点云计算胶囊激活,确保在点排列下保持一致的注意力。
- 通过训练同一物体的随机旋转版本对,对胶囊分解进行自监督,强制实现旋转下的等变性。
- 将注意力掩码聚合为语义关键点,作为监督信号,使胶囊行为与胶囊不变性/等变性原则对齐。
- 端到端学习一种规范化操作,使无论输入姿态如何,都能生成一致的以物体为中心的表征。
- 该架构在训练过程中不使用任何类别标签或配对数据,仅依赖旋转数据增强实现监督。
实验结果
研究问题
- RQ1能否在完全无监督的情况下学习3D点云中的胶囊表征,同时保持语义一致性?
- RQ2如何在无分类标签或对齐数据监督的情况下,强制实现胶囊的不变性与等变性?
- RQ3将注意力掩码聚合为语义关键点能否作为胶囊分解的有效监督信号?
- RQ4无监督胶囊学习在多大程度上能提升3D重建、配准和分类性能?
主要发现
- 所提方法在无需任何标注数据的情况下,实现了3D点云重建的最先进性能。
- 在3D配准任务中优于现有无监督方法,通过以物体为中心的表征实现了更高的对齐精度。
- 在无监督分类任务中表现强劲,表明所学习的胶囊捕捉到了语义上有意义的特征。
- 规范化操作使不同输入旋转下的物体表征保持一致,支持鲁棒的以物体为中心的推理。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。