[论文解读] 3D-QueryIS: A Query-based Framework for 3D Instance Segmentation
本文提出3D-QueryIS,一种新型基于查询的3D实例分割框架,无需检测器、无需语义分割、无需聚类。该方法通过隐式代表性点生成和基于Transformer的解码器生成实例查询,实现端到端的掩码与类别预测,显著降低任务间依赖性,提升推理效率,在多个基准测试中实现最先进性能,ScanNetV2上的推理时间仅为85ms。
Previous top-performing methods for 3D instance segmentation often maintain inter-task dependencies and the tendency towards a lack of robustness. Besides, inevitable variations of different datasets make these methods become particularly sensitive to hyper-parameter values and manifest poor generalization capability. In this paper, we address the aforementioned challenges by proposing a novel query-based method, termed as 3D-QueryIS, which is detector-free, semantic segmentation-free, and cluster-free. Specifically, we propose to generate representative points in an implicit manner, and use them together with the initial queries to generate the informative instance queries. Then, the class and binary instance mask predictions can be produced by simply applying MLP layers on top of the instance queries and the extracted point cloud embeddings. Thus, our 3D-QueryIS is free from the accumulated errors caused by the inter-task dependencies. Extensive experiments on multiple benchmark datasets demonstrate the effectiveness and efficiency of our proposed 3D-QueryIS method.
研究动机与目标
- 解决现有3D实例分割方法因依赖检测器、语义分割头或启发式聚类而产生的任务间依赖性问题。
- 通过消除检测、语义和聚类组件之间的依赖关系,减少误差累积并提升泛化能力。
- 设计一种更简单、更高效的框架,直接通过可学习查询预测实例掩码与类别,无需中间监督。
- 通过优化查询生成与掩码预测阶段,实现最小计算开销下的高性能表现。
提出的方法
- 该方法采用三阶段流程:初始特征提取、实例查询生成和实例掩码预测。
- 在实例查询生成阶段,代表性点生成(RPG)模块从体素嵌入中学习生成信息丰富且隐式的代表性点,以降低噪声和计算成本。
- 实例查询解码器(IQD)利用带有交叉注意力机制的Transformer解码器,将初始查询与代表性点进行交互,生成上下文感知的实例查询。
- 在实例掩码预测阶段,对生成的实例查询分别应用独立的MLP头,以预测类别标签和二值实例掩码。
- 整个框架可端到端训练,避免依赖边界框检测器、语义分割或聚类启发式方法。
- 该方法采用可学习查询初始化,并利用自注意力机制捕捉每个实例查询的全局上下文信息。
实验结果
研究问题
- RQ1基于查询的3D实例分割框架能否消除检测器驱动和分组方法固有的任务间依赖性?
- RQ2隐式、可学习的代表性点生成策略在提升实例查询质量并降低计算成本方面效果如何?
- RQ3完全无检测器、无语义分割、无聚类的框架在实现最先进性能和推理效率方面能达到何种程度?
- RQ4查询数量与代表性点数量如何影响精度与推理速度之间的权衡?
主要发现
- 3D-QueryIS在多个基准数据集(包括ScanNetV2、S3DIS和Waymo)上实现最先进性能,mAP和mIoU指标均有显著提升。
- 在ScanNetV2验证集上,该方法推理时间仅为每帧85ms,远超现有方法,且所有组件均在GPU上运行。
- 消融实验表明,将查询数K从50增加到100可提升性能,但K超过100后增益趋于平缓。
- 代表性点数量J在达到2000个点之前对性能有正向影响,之后性能趋于稳定,表明精度与成本之间存在稳定权衡。
- 可视化结果表明,3D-QueryIS避免了从语义预测中传播误差,而像SoftGroup等方法则会继承语义分支中的误差。
- 该方法展现出强泛化能力,无需在不同数据集上重新调整超参数,而以往方法对数据集差异较为敏感。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。