[论文解读] A Unified Framework with Multimodal Fine-tuning for Remote Sensing Semantic Segmentation
本论文提出MANet,一种统一框架,通过多模态适配器(MMAdapter)和基于金字塔的深度融合模块(DFM),对分割一切模型(SAM)进行微调,以实现多模态遥感语义分割。通过利用SAM的通用知识并采用参数高效微调方法,MANet在ISPRS Vaihingen和Potsdam数据集上实现了最先进性能,首次证明SAM能够有效处理非光学的数字地表模型(DSM)数据进行分割任务。
Multimodal remote sensing data, acquired from diverse sensors, offer a comprehensive and integrated perspective of the Earth's surface. Leveraging multimodal fusion techniques, semantic segmentation enables detailed and accurate analysis of geographic scenes, surpassing single-modality approaches. Building on advancements in vision foundation models, particularly the Segment Anything Model (SAM), this study proposes a unified framework incorporating a novel Multimodal Fine-tuning Network (MFNet) for remote sensing semantic segmentation. The proposed framework is designed to seamlessly integrate with various fine-tuning mechanisms, demonstrated through the inclusion of Adapter and Low-Rank Adaptation (LoRA) as representative examples. This extensibility ensures the framework's adaptability to other emerging fine-tuning strategies, allowing models to retain SAM's general knowledge while effectively leveraging multimodal data. Additionally, a pyramid-based Deep Fusion Module (DFM) is introduced to integrate high-level geographic features across multiple scales, enhancing feature representation prior to decoding. This work also highlights SAM's robust generalization capabilities with Digital Surface Model (DSM) data, a novel application. Extensive experiments on three benchmark multimodal remote sensing datasets, ISPRS Vaihingen, ISPRS Potsdam and MMHunan, demonstrate that the proposed MFNet significantly outperforms existing methods in multimodal semantic segmentation, setting a new standard in the field while offering a versatile foundation for future research and applications. The source code for this work is accessible at https://github.com/sstary/SSRS.
研究动机与目标
- 解决将大型视觉基础模型(如SAM)应用于与自然图像在传感器类型、分辨率和光谱特性方面显著不同的多模态遥感数据的挑战。
- 通过利用SAM等基础模型中嵌入的通用知识,克服现有模型仅在特定任务数据上训练所导致的局限性。
- 通过引入一种新型多模态适配器(MMAdapter),实现对遥感多模态数据(尤其是光学图像与DSM)的有效融合,该适配器在不进行完整微调的前提下微调SAM的图像编码器。
- 证明利用SAM图像编码器处理非光学数据(如数字地表模型DSM)的可行性和有效性,从而将SAM的应用范围从RGB图像扩展至其他模态。
- 开发一种可扩展、参数高效的框架,适用于单张GPU硬件部署,推动在资源受限的遥感应用中更广泛地采用大型基础模型。
提出的方法
- 在SAM的基于ViT的图像编码器中插入多模态适配器(MMAdapter),以实现对多模态遥感数据的参数高效微调。
- MMAdapter能够在多个编码器块中实现多模态特征(如光学图像与DSM)的连续融合,同时保留与任务无关的知识,并适应遥感模态的分布特性。
- 集成基于金字塔的深度融合模块(DFM),在解码前聚合来自不同模态的高层多尺度特征,增强语义表征学习能力。
- 保持SAM的提示编码器和掩码解码器不变,利用其强大的零样本泛化能力进行分割头推理。
- 采用适配器微调策略,冻结主干权重,最大限度减少可训练参数量和显存占用,同时保持高性能。
- 在高分辨率多模态数据集(ISPRS Vaihingen和Potsdam)上端到端训练模型,损失函数针对分割精度进行优化。
实验结果
研究问题
- RQ1预训练于自然图像的分割一切模型(SAM)能否被有效适配至涉及非光学数据(如DSM)的多模态遥感语义分割任务?
- RQ2所提出的多模态适配器(MMAdapter)在无需完整微调的情况下,对SAM图像编码器进行参数高效微调的有效性如何?
- RQ3基于金字塔的深度融合模块(DFM)在提升遥感分割中多尺度与多模态特征融合方面的贡献是什么?
- RQ4SAM中的通用知识在多模态遥感场景中,特别是在使用非光学模态(如DSM)时,其迁移能力如何?
- RQ5所提出的MANet框架能否在单张GPU上实现最低计算与内存开销的同时达到最先进性能?
主要发现
- MANet在使用ViT-H主干网络的ISPRS Potsdam数据集上实现了85.03%的平均交并比(mIoU),显著优于现有方法(如FTransUNet的84.23%和CMGFNet的82.26%)。
- 消融实验表明,MMAdapter和DFM均至关重要:移除任一模块均导致mIoU下降超过0.5个百分点,完整模型在Vaihingen数据集上达到84.72%的mIoU。
- 即使在批量大小从10减少到6的情况下,模型仍保持高性能,表明其在硬件资源受限条件下的鲁棒性与高效性。
- 仅使用一张NVIDIA RTX 3090 GPU即可训练ViT-L和ViT-H主干网络,可训练参数量分别为5667万和1.1128亿,证明其显存与参数开销极低。
- 热力图可视化结果表明,微调后的SAM编码器能够有效利用DSM数据,证实SAM在适当适配下可泛化至非光学模态。
- 本工作首次验证了SAM在DSM数据上的有效性,证明基础模型可通过极少架构改动成功适配至多模态遥感任务。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。