[论文解读] Learning to Orient Surfaces by Self-supervised Spherical CNNs
本文提出 Compass,一种自监督方法,通过球面卷积神经网络(spherical CNNs)学习点云表面的规范3D朝向,该网络固有地对3D旋转保持等变性。通过在经过旋转不变数据增强的原始数据上进行训练,Compass 能够预测一个旋转,将输入形状对齐至一致的规范坐标系,从而在旋转不变的形状分类和鲁棒的局部参考帧估计任务中取得最先进性能。
Defining and reliably finding a canonical orientation for 3D surfaces is key to many Computer Vision and Robotics applications. This task is commonly addressed by handcrafted algorithms exploiting geometric cues deemed as distinctive and robust by the designer. Yet, one might conjecture that humans learn the notion of the inherent orientation of 3D objects from experience and that machines may do so alike. In this work, we show the feasibility of learning a robust canonical orientation for surfaces represented as point clouds. Based on the observation that the quintessential property of a canonical orientation is equivariance to 3D rotations, we propose to employ Spherical CNNs, a recently introduced machinery that can learn equivariant representations defined on the Special Orthogonal group SO(3). Specifically, spherical correlations compute feature maps whose elements define 3D rotations. Our method learns such feature maps from raw data by a self-supervised training procedure and robustly selects a rotation to transform the input point cloud into a learned canonical orientation. Thereby, we realize the first end-to-end learning approach to define and extract the canonical orientation of 3D shapes, which we aptly dub Compass. Experiments on several public datasets prove its effectiveness at orienting local surface patches as well as whole objects.
研究动机与目标
- 为解决当前3D表面端到端学习的规范朝向估计缺乏问题,该问题目前依赖手工设计的几何启发式方法。
- 探索深度学习是否能通过经验模仿人类对规范朝向的习得方式,而非依赖预设的几何规则。
- 开发一种鲁棒的自监督框架,可泛化至未见过的旋转,并处理3D数据中的真实噪声和遮挡。
- 通过球面卷积神经网络学习一致且数据驱动的规范坐标系,实现3D视觉任务中旋转不变的处理。
- 证明利用 SO(3)-等变深度学习实现表面朝向估计的可行性,突破传统旋转不变或旋转等变网络的局限。
提出的方法
- 利用球面卷积神经网络,其通过在旋转群 SO(3) 上操作,被设计为对3D旋转保持等变性,以学习其坐标表示3D旋转的特征图。
- 采用自监督训练目标,通过数据增强模拟传感器噪声和遮挡,包括随机旋转和部分点云掩码。
- 将球面特征图的 argmax 作为预测的规范旋转,该旋转用于将输入点云变换至规范朝向。
- 引入可微分的数据增强流水线,使反向传播能够通过旋转和遮挡操作,支持端到端训练。
- 将学习到的朝向应用于下游任务(如形状分类和局部参考帧估计)以中和旋转变化。
- 采用两阶段训练策略:首先,Compass 在原始点云上端到端学习规范朝向;其次,该朝向用于预处理数据,再输入标准分类器(如 PointNet)
实验结果
研究问题
- RQ1深度神经网络能否在无显式监督的情况下,通过利用旋转等变性,学习到表面的规范3D朝向?
- RQ2基于自监督球面卷积神经网络的方法在旋转、噪声和部分观测条件下,估计一致且鲁棒的规范朝向的效率如何?
- RQ3通过深度网络学习规范朝向,是否能在局部表面片朝向和全局形状分类任务中超越手工设计的几何方法?
- RQ4该方法在不同数据集和物体类别之间泛化的程度如何,特别是在一个数据集上训练并在另一个数据集上测试时?
- RQ5使用 SO(3)-等变网络是否能相比标准旋转不变或数据增强模型,实现对未见旋转的更好泛化?
主要发现
- 当用于预处理 PointNet 输入时,Compass 在 ModelNet40 旋转测试集上达到 72.20% 的准确率,显著优于基线方法在任意旋转下失效的表现。
- 当未使用数据增强训练时,PointNet 在旋转测试数据上的准确率下降至 12.47%,但 Compass+PointNet 恢复至 72.20%,证明了学习规范朝向的有效性。
- 该方法在未见数据集上泛化良好:在 ModelNet40 上训练的模型能成功将 ShapeNet 数据集中的形状对齐至一致的规范坐标系,即使存在几何差异。
- Compass 在局部参考帧估计任务中达到最先进性能,对自遮挡和部分视图表现出强鲁棒性。
- 在规范朝向设置(NR)下,Compass+PointNet 的表现劣于原始 PointNet(80.51% vs. 89.82%),证实 Compass 的价值仅在存在旋转变化时才体现。
- 定性结果表明,Compass 在不同物体类别上均能生成一致的规范朝向,即使面对高度多变的形状,也显示出强大的泛化能力和不变性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。