[论文解读] SE(3)-Equivariant Attention Networks for Shape Reconstruction in Function Space
该论文提出TF-ONet,一种新型的SE(3)-等变、基于坐标的注意力网络,通过利用局部等变注意力机制,从无方向性、稀疏且噪声较大的点云中重建3D形状。该方法在单物体和多物体场景重建任务中均达到最先进性能,且在训练过程中无需预分割或姿态对齐,能稳健泛化至具有任意物体配置的新场景。
We propose a method for 3D shape reconstruction from unoriented point clouds. Our method consists of a novel SE(3)-equivariant coordinate-based network (TF-ONet), that parametrizes the occupancy field of the shape and respects the inherent symmetries of the problem. In contrast to previous shape reconstruction methods that align the input to a regular grid, we operate directly on the irregular point cloud. Our architecture leverages equivariant attention layers that operate on local tokens. This mechanism enables local shape modelling, a crucial property for scalability to large scenes. Given an unoriented, sparse, noisy point cloud as input, we produce equivariant features for each point. These serve as keys and values for the subsequent equivariant cross-attention blocks that parametrize the occupancy field. By querying an arbitrary point in space, we predict its occupancy score. We show that our method outperforms previous SO(3)-equivariant methods, as well as non-equivariant methods trained on SO(3)-augmented datasets. More importantly, local modelling together with SE(3)-equivariance create an ideal setting for SE(3) scene reconstruction. We show that by training only on single, aligned objects and without any pre-segmentation, we can reconstruct novel scenes containing arbitrarily many objects in random poses without any performance loss.
研究动机与目标
- 为解决从无方向性、稀疏且噪声较大的点云中进行3D形状重建的挑战,尤其是在多个物体以任意姿态排列的复杂场景中。
- 将SE(3)等变性作为归纳偏差,以在旋转和变换下保持几何对称性。
- 通过等变注意力层实现局部形状建模,高效扩展至大规模、非结构化的场景。
- 在仅使用单个标准物体进行训练的情况下,实现对包含多个物体在随机姿态下的新场景的高保真度重建。
- 超越标量和向量表示,利用注意力机制中的高阶张量场表示。
提出的方法
- 该方法采用两级架构:局部自注意力编码器从点云邻域中提取等变特征,交叉注意力占据网络在空间查询点上预测占据分数。
- 等变注意力层在局部标记上操作,基于张量场框架,支持更高阶表示(超越标量和向量),并确保在SE(3)变换下的不变性。
- 网络使用查询依赖的注意力机制,其中点特征作为键和值,查询的空间坐标用于生成占据分数预测。
- 模型在标准对齐的单个物体上端到端训练,并泛化至任意数量物体以随机姿态排列的场景,无需微调或分割。
- 等变性在特定几何区域——等变区域——中形式化确立,即在点云独立进行SO(3)旋转时,查询最近邻点保持一致。
- 该架构避免使用网格化表示,直接在非规则点云上运行,保持可扩展性并实现拓扑无关的重建。
实验结果
研究问题
- RQ1基于坐标的网络若采用SE(3)-等变注意力,是否能在无方向性、稀疏且噪声较大的点云上实现优于非等变及SO(3)-等变基线方法的3D形状重建?
- RQ2局部注意力结合等变特征学习是否能实现对包含多个物体在任意姿态下的新场景的泛化,即使仅在单个标准物体上进行训练?
- RQ3相较于标量和向量,高阶张量表示(如更高阶)在等变形状重建中的性能提升程度如何?
- RQ4模型是否能在不显式进行分割或姿态监督的情况下,保持在复杂场景级变换下的等变性?
- RQ5模型在不同场景构型下的性能表现如何扩展,包括未见过的物体类别和配置?
主要发现
- TF-ONet在单物体和多物体重建基准测试中,优于SO(3)-等变方法(如Vector Neurons和GraphOnet)以及采用SO(3)数据增强训练的非等变模型。
- 在Seismic数据集上,该模型实现了最先进定量结果,尤其在随机放置物体的场景中,重建质量显著优于基线方法。
- 在Matterport3D上的定性评估显示,该模型能泛化至包含未见物体类别的真实世界场景,无需微调或分割即可生成高保真重建结果。
- 该方法在定义的等变区域内保持等变性,即在点云独立进行SO(3)旋转时,查询点的最近邻点保持一致。
- 该模型能泛化至包含任意数量物体在随机姿态下的新场景,实现高质量重建,且性能无下降,即使仅在单个对齐物体上进行训练。
- 通过张量场框架使用高阶张量表示,实现了比仅使用标量和向量的方法更具表现力的特征学习,从而提升了整体性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。