[论文解读] Incomplete Multimodal Learning for Remote Sensing Data Fusion
本文提出了一种基于Transformer的新颖框架,用于不完整多模态遥感数据融合,能够在推理阶段缺少或部分模态的情况下实现鲁棒性能。通过在类似MultiMAE的设置中整合双向LSTM注意力、掩码自注意力以及对比/重建预训练,该模型在DFC2023和四元组数据集上的实例分割与土地覆盖制图任务中均取得了最先进结果,即使在单模态输入下也表现优异。
The mechanism of connecting multimodal signals through self-attention operation is a key factor in the success of multimodal Transformer networks in remote sensing data fusion tasks. However, traditional approaches assume access to all modalities during both training and inference, which can lead to severe degradation when dealing with modal-incomplete inputs in downstream applications. To address this limitation, our proposed approach introduces a novel model for incomplete multimodal learning in the context of remote sensing data fusion. This approach can be used in both supervised and self-supervised pretraining paradigms and leverages the additional learned fusion tokens in combination with Bi-LSTM attention and masked self-attention mechanisms to collect multimodal signals. The proposed approach employs reconstruction and contrastive loss to facilitate fusion in pre-training while allowing for random modality combinations as inputs in network training. Our approach delivers state-of-the-art performance on two multimodal datasets for tasks such as building instance / semantic segmentation and land-cover mapping tasks when dealing with incomplete inputs during inference.
研究动机与目标
- 解决现有多模态遥感模型在推理阶段面临不完整模态条件时失效的局限性。
- 开发一种统一的学习框架,使模型在训练和推理过程中能泛化至所有可能的可用模态子集。
- 在监督和自监督范式下实现有效的预训练与微调,同时保持在不完整输入下的性能。
- 通过促进模态不变表示学习,克服标准多模态融合中对主导模态的过拟合问题。
提出的方法
- 提出一种基于MultiMAE的预训练策略,结合重建损失和对比损失,以学习鲁棒的多模态表示。
- 采用掩码自注意力机制,在训练中通过随机掩码输入模态并预测其内容来处理缺失模态。
- 利用双向LSTM注意力建模模态间的序列依赖关系,增强特征交互与融合能力。
- 引入可学习的融合令牌以聚合多模态信号,提升表示学习效果。
- 在训练中采用随机模态组合策略,使用不同模态子集作为输入,以提升泛化能力。
- 支持监督微调和自监督预训练,使模型可部署于多样化的下游任务。

实验结果
研究问题
- RQ1统一的多模态Transformer模型在推理阶段测试时,面对不完整或缺失模态是否仍能保持高性能?
- RQ2双向LSTM注意力与掩码自注意力的结合如何提升不完整多模态学习中的鲁棒性?
- RQ3通过重建损失和对比损失进行预训练,在多样化模态组合中能在多大程度上提升泛化能力?
- RQ4所提方法在所有模态子集(包括单模态输入)上的性能一致性是否优于现有方法?
- RQ5该模型是否能在无需模态特定微调的情况下,有效泛化至不同遥感数据集?
主要发现
- 在DFC2023 track2数据集上,该方法在使用全部三种模态(SAR、RGB、DSM)时,实例分割的AP@50达到0.333,语义分割的mIoU达到0.851,优于所有基线模型。
- 即使仅使用SAR和RGB输入,模型仍保持0.296 AP@50和0.809 mIoU的性能,展现出对缺失模态的强大鲁棒性。
- 在单模态推理中,SAR仅输入时,模型达到0.040 AP@50和0.552 mIoU,显著优于基线的0.028 AP@50和0.509 mIoU。
- 在四元组数据集上,使用全部四种模态(S1、S2、DEM、DNW)时,模型达到0.244 mIoU,即使仅使用两个模态或单模态输入,mIoU仍保持在0.220以上。
- 在微调范式下,全模态输入时模型达到0.300 AP@50和0.849 mIoU,而在SAR+RGB输入下仍保持0.260 AP@50和0.798 mIoU,表明在不同设置下性能一致。
- 在监督和自监督预训练设置下,该模型均优于现有方法,尤其在不完整输入下表现更优,证实了其泛化能力。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。