[论文解读] Are Multimodal Transformers Robust to Missing Modality?
本文研究了多模态Transformer在模态缺失情况下的鲁棒性,发现其对模态缺失极为敏感,且最优融合策略具有数据集依赖性而非通用性。为解决此问题,作者提出一种具有可微搜索的多任务学习框架,以自动学习最优融合层,显著提升了在三种基准数据集上的模态缺失条件下的性能。
Multimodal data collected from the real world are often imperfect due to missing modalities. Therefore multimodal models that are robust against modal-incomplete data are highly preferred. Recently, Transformer models have shown great success in processing multimodal data. However, existing work has been limited to either architecture designs or pre-training strategies; whether Transformer models are naturally robust against missing-modal data has rarely been investigated. In this paper, we present the first-of-its-kind work to comprehensively investigate the behavior of Transformers in the presence of modal-incomplete data. Unsurprising, we find Transformer models are sensitive to missing modalities while different modal fusion strategies will significantly affect the robustness. What surprised us is that the optimal fusion strategy is dataset dependent even for the same Transformer model; there does not exist a universal strategy that works in general cases. Based on these findings, we propose a principle method to improve the robustness of Transformer models by automatically searching for an optimal fusion strategy regarding input data. Experimental validations on three benchmarks support the superior performance of the proposed method.
研究动机与目标
- 研究多模态Transformer在真实世界数据中面临模态缺失时的鲁棒性。
- 确定现有融合策略(早期、晚期或中间)在模态缺失条件下是否具有跨数据集的泛化能力。
- 通过开发一种基于数据集特征自动学习最优融合的模型,解决缺乏通用融合策略的问题。
- 通过在完整数据和不完整数据上联合优化,提升模型鲁棒性,从而在模态缺失场景下实现更好的泛化能力。
提出的方法
- 提出一种多任务学习框架,联合在模态完整和模态不完整数据上进行训练,以增强模型鲁棒性。
- 将最优融合层的搜索形式化为双层优化问题,实现融合策略的端到端可微学习。
- 引入模态特定的注意力掩码,防止分类标记在推理过程中关注无关模态。
- 使用可学习的策略网络,为每个输入样本预测最优融合层深度,动态适应输入模态的可用性。
- 通过在完整数据上使用交叉熵损失和在不完整数据上使用正则化损失联合训练模型,以维持性能。
- 采用基于梯度的优化方法,同时更新融合策略和模型参数,实现对融合配置的高效搜索。
实验结果
研究问题
- RQ1当测试数据中存在模态缺失时,多模态Transformer的性能如何,尤其与单模态基线相比表现如何?
- RQ2在模态缺失条件下,融合策略的选择(早期、晚期或中间)是否显著影响模型鲁棒性?
- RQ3是否存在一种在模态缺失时对不同数据集均适用的通用融合策略?
- RQ4与标准预训练相比,使用不完整数据的多任务学习是否能显著提升鲁棒性?
- RQ5可微搜索在识别每组数据集或每个输入的最优融合层方面是否有效?
主要发现
- 当模态缺失时,多模态Transformer性能显著下降,部分数据集上甚至低于单模态基线,尤其在文本模态严重减少时更为明显。
- 在MM-IMDb和Hateful Memes数据集中,早期融合在模态缺失条件下优于晚期融合;而在UPMC Food-101数据集中,晚期融合表现更优,证明最优策略具有数据集依赖性。
- 所提方法在MM-IMDb(10%文本)上达到46.6 F1-Macro,优于新基线(40.4)和单模态图像基线(31.2),展现出强大的鲁棒性。
- 在UPMC Food-101上,该方法在仅10%文本条件下达到77.5%准确率,超过新基线(44.3%)和单模态图像基线(65.9%),表现一致提升。
- 消融实验证实,多任务学习对鲁棒性的贡献大于融合策略搜索,在仅10%文本时性能提升达30%。
- 注意力掩码至关重要:在MM-IMDb上移除掩码会使F1-Macro从37.3降至23.0,证实模态隔离可有效防止推理过程中的干扰。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。