[论文解读] 3DCFS: Fast and Robust Joint 3D Semantic-Instance Segmentation via Coupled Feature Selection
本文提出3DCFS,一种用于联合3D语义与实例分割的快速且鲁棒的端到端框架,采用耦合特征选择机制。它引入了一种新颖的CFSM模块,通过门控机制自适应融合特定任务特征,同时提出一种新型损失函数($ olcal{E}_{EMED}$),通过平衡嵌入维度的幅值来提升欧氏距离的可靠性,从而在S3DIS和ShapeNet数据集上实现了最先进的准确率、速度与效率。
We propose a novel fast and robust 3D point clouds segmentation framework via coupled feature selection, named 3DCFS, that jointly performs semantic and instance segmentation. Inspired by the human scene perception process, we design a novel coupled feature selection module, named CFSM, that adaptively selects and fuses the reciprocal semantic and instance features from two tasks in a coupled manner. To further boost the performance of the instance segmentation task in our 3DCFS, we investigate a loss function that helps the model learn to balance the magnitudes of the output embedding dimensions during training, which makes calculating the Euclidean distance more reliable and enhances the generalizability of the model. Extensive experiments demonstrate that our 3DCFS outperforms state-of-the-art methods on benchmark datasets in terms of accuracy, speed and computational cost.
研究动机与目标
- 为解决传统顺序或简单联合学习在3D语义与实例分割中的局限性,即上游错误会降低下游性能。
- 通过以类人感知启发的耦合方式建模语义与实例分割任务之间的相互依赖关系,挖掘二者间的互惠信息。
- 通过平衡嵌入维度的幅值,提升基于欧氏距离的实例嵌入相似性计算的可靠性,避免因单个维度主导而产生的偏差。
- 开发一种高效、端到端的框架,在降低计算成本与推理时间的同时实现高性能。
- 在S3DIS与ShapeNet等多个基准数据集上,全面展示其在准确率与推理速度方面的SOTA性能。
提出的方法
- 提出一种耦合特征选择模块(CFSM),采用双门控流结构——一个从实例到语义,另一个从语义到实例,实现对特定任务特征的选择性融合。
- 在CFSM中引入门控机制,动态抑制无关或冲突的特征,实现自适应、任务感知的特征融合。
- 提出一种新型损失函数$ olcal{E}_{EMED}$,通过鼓励嵌入维度间幅值的均衡,稳定并提升基于欧氏距离的聚类性能。
- 采用PointNet/PointNet++作为主干编码器,并在解码器中应用CFSM,实现对两类分割任务的端到端联合优化。
- 在学习到的嵌入上应用欧氏距离进行实例聚类,其中$ olcal{E}_{EMED}$确保无单一维度主导距离计算。
- 采用共享主干与联合训练策略,实现参数效率,并促进两类任务间的相互监督。
实验结果
研究问题
- RQ1基于门控的耦合特征选择机制是否能超越传统多任务学习,在联合3D语义与实例分割中实现性能提升?
- RQ2平衡嵌入维度的幅值是否能显著提升基于欧氏距离的实例聚类可靠性?
- RQ3类人感知的、语义与实例分割任务间的双向信息流是否能带来更优的性能与鲁棒性?
- RQ4在标准基准上,所提出的3DCFS框架在速度、准确率与内存效率方面与现有SOTA方法相比表现如何?
- RQ5$ olcal{E}_{EMED}$损失在多大程度上提升了泛化能力,并降低了对嵌入维度缩放的敏感性?
主要发现
- 在S3DIS上,3DCFS在语义分割中达到62.3 mAcc,在实例分割中达到54.7 mPrec,两项指标均优于SOTA方法。
- $ olcal{E}_{EMED}$损失成功平衡了嵌入维度的平均幅值,降低了方差,提升了聚类可靠性,如图6所示。
- 在S3DIS上,3DCFS每轮训练仅耗时26.4分钟,显存占用2,227 MB,显著快于SGPN(59.3分钟,7,549 MB)与ASIS(64.7分钟,4,275 MB)。
- 在S3DIS上的推理时间也更短,仅需36.3分钟与307 MB,优于SGPN(209.5分钟,420 MB)与ASIS(54.2分钟,1,235 MB)。
- 在ShapeNet上,3DCFS在语义分割中达到87.6 mIoU,较SGPN高出1.8 mIoU,展现出在部件级分割任务中的强大泛化能力。
- 定性结果表明,3DCFS能正确分割复杂物体(如汽车与椅子),避免了基线方法中常见的过分割或欠分割错误。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。