[论文解读] CMX: Cross-Modal Fusion for RGB-X Semantic Segmentation with Transformers
本文提出CMX,一种基于Transformer的统一跨模态融合框架,用于RGB-X语义分割,可泛化于深度、热成像、偏振、事件和LiDard等多种模态。通过引入用于双向特征校准的跨模态特征校正模块(CM-FRM)以及采用交叉注意力机制的特征融合模块(FFM)以实现长距离上下文交换,CMX在九个基准测试中达到最先进性能,包括在EventScape数据集上实现RGB-事件分割的新SOTA。
Scene understanding based on image segmentation is a crucial component of autonomous vehicles. Pixel-wise semantic segmentation of RGB images can be advanced by exploiting complementary features from the supplementary modality (X-modality). However, covering a wide variety of sensors with a modality-agnostic model remains an unresolved problem due to variations in sensor characteristics among different modalities. Unlike previous modality-specific methods, in this work, we propose a unified fusion framework, CMX, for RGB-X semantic segmentation. To generalize well across different modalities, that often include supplements as well as uncertainties, a unified cross-modal interaction is crucial for modality fusion. Specifically, we design a Cross-Modal Feature Rectification Module (CM-FRM) to calibrate bi-modal features by leveraging the features from one modality to rectify the features of the other modality. With rectified feature pairs, we deploy a Feature Fusion Module (FFM) to perform sufficient exchange of long-range contexts before mixing. To verify CMX, for the first time, we unify five modalities complementary to RGB, i.e., depth, thermal, polarization, event, and LiDAR. Extensive experiments show that CMX generalizes well to diverse multi-modal fusion, achieving state-of-the-art performances on five RGB-Depth benchmarks, as well as RGB-Thermal, RGB-Polarization, and RGB-LiDAR datasets. Besides, to investigate the generalizability to dense-sparse data fusion, we establish an RGB-Event semantic segmentation benchmark based on the EventScape dataset, on which CMX sets the new state-of-the-art. The source code of CMX is publicly available at https://github.com/huaaaliu/RGBX_Semantic_Segmentation.
研究动机与目标
- 为解决自动驾驶中多模态语义分割缺乏模态无关模型的问题。
- 在单一统一架构中实现RGB与多样化互补传感模态(如深度、热成像、事件、LiDAR)的有效融合。
- 通过跨模态特征校正提升在低纹理、低光照和高动态范围场景下的鲁棒性与准确性。
- 建立新的RGB-事件语义分割基准,以评估密集-稀疏融合能力。
- 开发一种可泛化、高效且准确的解决方案,用于真实世界自动驾驶车辆感知。
提出的方法
- 提出一种跨模态特征校正模块(CM-FRM),通过RGB与X模态特征之间的交叉注意力,实现通道和空间维度的特征校准。
- 采用具有序列到序列交叉注意力和混合通道嵌入的特征融合模块(FFM),以实现长距离上下文特征的双向交换。
- 使用基于视觉Transformer的编码器(如SegFormer)对RGB和X模态输入进行联合特征提取。
- 通过将所有模态统一处理于CMX架构中,无需针对每对模态重新设计网络结构,实现模态无关的融合。
- 基于EventScape数据集引入一个新的RGB-事件语义分割基准,用于评估密集-稀疏融合能力。
- 采用端到端训练,结合交叉熵损失和Dice损失,以多模态分割任务中的mIoU为优化目标。
实验结果
研究问题
- RQ1单一统一模型能否有效融合RGB与多样化、非对称模态(如深度、热成像、偏振、事件和LiDAR)?
- RQ2跨模态特征校正如何提升在低纹理、低光照或高动态范围场景下的性能?
- RQ3结合特征校正的双向交叉注意力是否优于单向或早期融合,在长距离上下文建模方面表现更优?
- RQ4CMX能否泛化至稀疏-密集数据融合任务,如将高频率事件数据与标准RGB图像结合?
- RQ5CMX在多个基准数据集上相较于现有模态专用模型的性能增益如何?
主要发现
- 在使用SegFormer-B5的NYU Depth V2数据集上,CMX实现了56.8%的mIoU,达到SOTA性能,优于先前方法。
- 在基于EventScape数据集的新RGB-事件基准上,CMX实现了新的SOTA mIoU,证明其在稀疏-密集融合任务中具有强大泛化能力。
- 在RGB-热成像任务中,CMX相比仅使用RGB的基线模型,在低光照条件下将分割准确率提升了5.2% mIoU。
- CM-FRM模块降低了LiDIDar数据中的噪声敏感性,即使在点云稀疏或噪声较大的情况下,也能实现对车辆的完整且准确的分割。
- CMX搭配SegFormer-B2仅需67.6 GFLOPs即可达到54.1% mIoU,在实时应用中实现了出色的准确率-效率权衡。
- 定性结果表明,CMX能正确分割玻璃表面、运动物体和低纹理区域(如将床识别为沙发)等具有挑战性的场景,有效利用了模态特异性线索。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。