[论文解读] Delivering Arbitrary-Modal Semantic Segmentation
本文提出CMNeXt,一种新颖的任意模态语义分割模型,通过自查询枢纽(SQ-Hub)实现动态特征选择,以及并行池化混合器(PPX)实现高效的跨模态线索提取,可灵活融合1至81种模态。该模型在六个基准测试中达到最先进性能,包括在新提出的DeLiVER数据集上实现66.30%的mIoU,较仅使用RGB的基线模型提升9.10%。
Multimodal fusion can make semantic segmentation more robust. However, fusing an arbitrary number of modalities remains underexplored. To delve into this problem, we create the DeLiVER arbitrary-modal segmentation benchmark, covering Depth, LiDAR, multiple Views, Events, and RGB. Aside from this, we provide this dataset in four severe weather conditions as well as five sensor failure cases to exploit modal complementarity and resolve partial outages. To make this possible, we present the arbitrary cross-modal segmentation model CMNeXt. It encompasses a Self-Query Hub (SQ-Hub) designed to extract effective information from any modality for subsequent fusion with the RGB representation and adds only negligible amounts of parameters (~0.01M) per additional modality. On top, to efficiently and flexibly harvest discriminative cues from the auxiliary modalities, we introduce the simple Parallel Pooling Mixer (PPX). With extensive experiments on a total of six benchmarks, our CMNeXt achieves state-of-the-art performance on the DeLiVER, KITTI-360, MFNet, NYU Depth V2, UrbanLF, and MCubeS datasets, allowing to scale from 1 to 81 modalities. On the freshly collected DeLiVER, the quad-modal CMNeXt reaches up to 66.30% in mIoU with a +9.10% gain as compared to the mono-modal baseline. The DeLiVER dataset and our code are at: https://jamycheung.github.io/DELIVER.html.
研究动机与目标
- 解决语义分割中任意数量模态融合的研究不足,特别是在真实传感器故障和恶劣环境条件下的问题。
- 克服现有方法仅针对固定模态对设计的局限性,提升可扩展性与鲁棒性。
- 开发统一框架,实现对RGB、深度、LiDAR、事件、偏振、光场等多样化模态的动态集成,同时保持低计算开销。
- 通过利用模态间的互补信息,在部分传感器故障和恶劣天气条件下实现鲁棒分割。
- 构建全面的基准数据集DeLiVER,以支持在真实故障与环境条件下进行任意模态语义分割的研究。
提出的方法
- 提出Hub2Fuse范式,采用非对称分支结构:一个用于RGB,另一个用于辅助模态,实现灵活高效的融合。
- 设计自查询枢纽(SQ-Hub),在融合前从任意数量的补充模态中动态选择信息丰富的特征,每种模态仅增加约0.01M参数。
- 引入并行池化混合器(PPX),一种轻量化模块,通过在模态间并行应用空间池化,高效提取判别性跨模态线索。
- 将PPX与交叉融合模块结合,有效处理密集模态(如RGB)和稀疏模态(如LiDAR、事件)。
- 在RGB分支中使用MHSA模块,在辅助分支中使用PPX,表明自注意力在处理密集表示方面表现优异,而PPX在提取跨模态知识方面更具优势。
- 开展广泛的消融实验,验证SQ-Hub、PPX及其组件(如SE模块、FRM/FFM模块)的有效性。
实验结果
研究问题
- RQ1统一模型是否能在1至81种模态的多样化、任意组合下实现语义分割的最先进性能?
- RQ2随着模态数量的增加,CMNeXt模型如何在保持高精度的同时控制参数增长?
- RQ3在LiDAR抖动或部分故障等传感器故障场景下,模型的鲁棒性能够维持到何种程度?
- RQ4与基于卷积、池化或注意力的替代方法相比,PPX模块在从多样化模态中提取判别性特征方面的有效性如何?
- RQ5SQ-Hub机制是否能够实现动态、模态无关的特征选择,从而提升融合效率与性能?
主要发现
- 在DeLiVER基准上,CMNeXt在四模态设置(RGB、深度、事件、LiDAR)下实现66.30%的mIoU,较仅使用RGB的基线模型提升9.10%。
- CMNeXt在UrbanLF-Real上较之前SOTA方法提升+3.90% mIoU,在MCubeS上提升+8.68%,展现出在不同数据集间的强大泛化能力。
- PPX模块在所有测试模块中取得最高mIoU(66.30%),同时仅使用58.73M参数和65.42 GFLOPs。
- 消融实验表明,若在PPX中移除SE模块,mIoU下降3.03%,证实通道注意力在跨模态特征学习中的重要性。
- FRM与FFM模块显著增强了跨模态交互,消融实验显示若将其移除,mIoU下降1.89%。
- 在传感器故障场景(如LiDAR抖动)下,CMNeXt保持鲁棒性能,而CMX与HRFuser等先前方法则出现显著性能下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。