[论文解读] PointCAT: Cross-Attention Transformer for point cloud
PointCAT 提出了一种用于三维点云理解的双分支交叉注意力 Transformer 架构,通过多尺度特征学习和交叉注意力机制捕捉长距离依赖关系,同时降低计算成本。该模型在形状分类、部件分割和语义分割基准上实现了最先进或具有竞争力的性能,参数量为 33.1M,通过类别标记优化显著减少了 FLOPs 和推理时间。
Transformer-based models have significantly advanced natural language processing and computer vision in recent years. However, due to the irregular and disordered structure of point cloud data, transformer-based models for 3D deep learning are still in their infancy compared to other methods. In this paper we present Point Cross-Attention Transformer (PointCAT), a novel end-to-end network architecture using cross-attentions mechanism for point cloud representing. Our approach combines multi-scale features via two seprate cross-attention transformer branches. To reduce the computational increase brought by multi-branch structure, we further introduce an efficient model for shape classification, which only process single class token of one branch as a query to calculate attention map with the other. Extensive experiments demonstrate that our method outperforms or achieves comparable performance to several approaches in shape classification, part segmentation and semantic segmentation tasks.
研究动机与目标
- 为解决深度学习中不规则、无序的 3D 点云数据挑战,设计一种排列不变的架构。
- 通过引入双分支交叉注意力机制,提升点云中长距离和多层级的特征表示能力。
- 在不牺牲性能的前提下,降低多分支 Transformer 设计中的计算复杂度。
- 实现高效端到端学习,用于分类、部件分割和语义分割等 3D 理解任务。
提出的方法
- 通过最远点采样和 k-最近邻分组,利用分层残差 MLP 从点云中提取多尺度局部特征。
- 引入双分支交叉注意力机制,其中一支处理位置特征,另一支处理内容特征,实现跨分支的特征交互。
- 在每个分支的序列中添加可学习的类别标记,并将其用作查询,与另一分支的特征计算注意力图,从而降低计算量。
- 通过残差连接和堆叠的交叉注意力层,保持梯度流动并增强特征学习。
- 通过融合两个分支的类别标记实现特征融合,实验表明其比全局特征拼接更具判别性。
- 使用标准交叉熵损失进行模型优化,并在 ModelNet40 和 S3DIS 数据集上端到端训练。
实验结果
研究问题
- RQ1双分支交叉注意力机制是否能有效增强 3D 点云中的多尺度特征表示?
- RQ2在不规则点云数据中,交叉注意力与标准自注意力相比,在捕捉长距离依赖关系方面表现如何?
- RQ3在多分支 Transformer 中,使用单个类别标记查询是否能降低计算成本,同时保持性能?
- RQ4在点云任务中,结合两个交叉注意力分支特征的最佳融合策略是什么?
主要发现
- PointCAT 在 ModelNet40 分类任务中达到 90.9% 的 mAcc 和 93.5% 的 OA,优于多个先前方法。
- 在 S3DIS 部件分割任务中,模型达到 71.0% 的 mAcc 和 88.2% 的 OA,展现出强大的跨任务泛化能力。
- 与标准自注意力相比,交叉注意力机制在分类任务中降低 1.5% 的误差,在分割任务中提升 mIoU 2.3%。
- 通过使用单类别标记查询,模型在 S3DIS 上将 FLOPs 减少 50%,参数量减少 62%(从 87.6M 降至 33.1M),每轮训练加速 8 秒。
- 将两个分支的类别标记视为独立全局特征进行融合(即部件标记融合),在 ModelNet40 上实现最佳性能,mAcc 达 90.9%,OA 达 93.5%。
- 将两个分支的所有特征进行拼接的特征聚合方式表现较差,因其全局描述符判别性较弱,证实了基于类别标记的融合策略更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。