[论文解读] AsymFormer: Asymmetrical Cross-Modal Representation Learning for Mobile Platform Real-Time RGB-D Semantic Segmentation
AsymFormer 提出了一种用于移动平台实时 RGB-D 语义分割的非对称跨模态表征学习框架,通过为深度信息使用轻量级 Transformer 主干网络、为 RGB 图像使用 CNN 来减少冗余。其在 NYUv2 数据集上达到 52.0% 的 mIoU,推理速度达 65 FPS(使用混合精度时为 79 FPS),在速度-精度平衡方面优于先前方法,同时通过局部注意力和跨模态相关性模块将参数量降至最低。
Understanding indoor scenes is crucial for urban studies. Considering the dynamic nature of indoor environments, effective semantic segmentation requires both real-time operation and high accuracy.To address this, we propose AsymFormer, a novel network that improves real-time semantic segmentation accuracy using RGB-D multi-modal information without substantially increasing network complexity. AsymFormer uses an asymmetrical backbone for multimodal feature extraction, reducing redundant parameters by optimizing computational resource distribution. To fuse asymmetric multimodal features, a Local Attention-Guided Feature Selection (LAFS) module is used to selectively fuse features from different modalities by leveraging their dependencies. Subsequently, a Cross-Modal Attention-Guided Feature Correlation Embedding (CMA) module is introduced to further extract cross-modal representations. The AsymFormer demonstrates competitive results with 54.1% mIoU on NYUv2 and 49.1% mIoU on SUNRGBD. Notably, AsymFormer achieves an inference speed of 65 FPS (79 FPS after implementing mixed precision quantization) on RTX3090, demonstrating that AsymFormer can strike a balance between high accuracy and efficiency.
研究动机与目标
- 为解决对称双分支网络在 RGB-D 语义分割中效率低下的问题,此类网络使计算成本翻倍但精度提升有限。
- 通过设计一个轻量化深度分支与强大 RGB 分支的非对称主干网络,减少模型冗余。
- 通过引入局部注意力引导特征选择(LAFS)模块,实现空间-通道注意力的并行建模,提升特征融合效率。
- 通过跨模态注意力(CMA)模块增强跨模态表征学习,以极小的参数增加捕捉多模态自相似性。
- 在移动机器人平台上实现更优的速度-精度权衡,优先保障实时推理,同时不牺牲分割质量。
提出的方法
- AsymFormer 使用基于 CNN 的主干网络提取 RGB 特征,使用更小、参数高效的 Transformer 主干网络提取深度特征,以减少计算冗余。
- 局部注意力引导特征选择(LAFS)模块通过可学习通道权重和空间注意力,并行计算空间-通道注意力权重,实现快速、选择性融合。
- LAFS 通过可学习权重估计模态差异,实现空间注意力建模,在保持高推理速度的同时提升特征选择能力。
- 跨模态注意力(CMA)模块通过建模跨模态的自相似性,增强跨模态表征,以极小的参数开销提升特征相关性。
- 特征融合由注意力图引导,动态根据空间和通道依赖关系加权 RGB 与深度分支的贡献。
- 采用混合精度推理进一步加速推理,在 RTX 3090 上实现 79 FPS 的速度且无精度损失。

实验结果
研究问题
- RQ1非对称主干设计是否能在不牺牲精度的前提下减少多模态语义分割中的参数冗余?
- RQ2如何在保持空间与通道注意力保真度的同时,优化实时性能下的特征选择?
- RQ3多模态自相似性特征在参数增加极少的情况下,能在多大程度上提升分割精度?
- RQ4轻量化跨注意力机制是否能在实时场景中有效增强跨模态表征学习?
- RQ5所提方法在移动机器人平台上是否优于现有 SOTA 方法,实现更优的速度-精度权衡?
主要发现
- AsymFormer 在 NYUv2 数据集上达到 52.0% 的 mIoU,精度与速度均优于大多数现有方法。
- 在 RTX 3090 上,AsymFormer 实现 65 FPS 的全精度推理速度,混合精度量化下达到 79 FPS,显著优于先前方法的速度表现。
- 模型仅用 33M 参数即保持 52.0% 的 mIoU,展现出极高的效率与极低的参数量。
- 在 SUNRGBD 数据集上,AsymFormer 达到 49.1% 的 mIoU,尽管该数据集的深度图像质量较低,仍表现出具有竞争力的性能。
- 可视化结果表明,LAFS 生成的注意力图比 CBAM 更具连贯性与信息量,边缘保留更好,对象一致性更优。
- 消融实验验证了非对称主干、LAFS 与 CMA 模块的组合在速度与精度上均有显著提升。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。