[论文解读] Investigating Vulnerability to Adversarial Examples on Multimodal Data Fusion in Deep Learning
本文研究了多模态深度学习融合模型的对抗鲁棒性,特别是使用RGB和热成像(IR)输入进行语义分割的MFNet模型。尽管通过互补模态融合优化了预测性能,该模型在梯度-based对抗攻击下仍极为脆弱——即使仅一个模态(如RGB或IR)被扰动,也会导致显著的性能下降,表明当前的融合模型并未充分利用互补关系来增强鲁棒性。
The success of multimodal data fusion in deep learning appears to be attributed to the use of complementary in-formation between multiple input data. Compared to their predictive performance, relatively less attention has been devoted to the robustness of multimodal fusion models. In this paper, we investigated whether the current multimodal fusion model utilizes the complementary intelligence to defend against adversarial attacks. We applied gradient based white-box attacks such as FGSM and PGD on MFNet, which is a major multispectral (RGB, Thermal) fusion deep learning model for semantic segmentation. We verified that the multimodal fusion model optimized for better prediction is still vulnerable to adversarial attack, even if only one of the sensors is attacked. Thus, it is hard to say that existing multimodal data fusion models are fully utilizing complementary relationships between multiple modalities in terms of adversarial robustness. We believe that our observations open a new horizon for adversarial attack research on multimodal data fusion.
研究动机与目标
- 探究多模态数据融合模型是否充分利用互补信息以实现对抗鲁棒性。
- 评估基于梯度的对抗攻击(FGSM和PGD)对语义分割中多模态融合模型的影响。
- 确定在仅一个模态被攻击的情况下,尽管采用融合架构,鲁棒性是否仍会受损。
- 揭示多模态深度学习中对抗鲁棒性研究的差距,尤其是与性能提升相比。
- 提供关于多模态融合系统中对抗脆弱性的实证证据和理论洞察。
提出的方法
- 在MFNet模型的RGB和IR输入上应用FGSM和PGD攻击,扰动范数$\epsilon$取不同$l_∞$值。
- 使用$IoU_R = \frac{mIoU_{AP}}{mIoU_{CO}}$作为主要指标评估鲁棒性,比较对抗样本与干净输入的性能。
- 在多模态语义分割基准上训练并评估MFNet,引入未标记的背景类别以实现准确比较。
- 追踪不同攻击场景和$\epsilon$值下,平均交并比(mIoU)、平均准确率(mAcc)和$IoU_R$的变化。
- 通过分别攻击单个模态(仅RGB、仅IR)及两者同时攻击,进行消融研究以隔离脆弱性来源。
- 应用理论分析,将对抗脆弱性与非鲁棒特征联系起来,即使在融合架构中也是如此。
实验结果
研究问题
- RQ1与单模态模型相比,深度学习模型中的多模态融合是否能增强对抗鲁棒性?
- RQ2仅扰动一个输入模态(如RGB或IR)在多大程度上会降低多模态融合模型的性能?
- RQ3基于梯度的对抗攻击(如FGSM和PGD)是否仍会显著降低多模态融合模型的鲁棒性,尽管其设计具有互补性?
- RQ4多模态融合带来的性能提升是否因跨模态缺乏鲁棒特征学习而被削弱?
- RQ5当前的融合架构是否充分利用了多模态在对抗韧性方面的互补特性?
主要发现
- 即使仅对RGB模态施加$\epsilon = 40$的扰动,$IoU_R$也从41.9%降至35.0%,表明性能严重下降。
- 当仅对IR模态施加$\epsilon = 40$的扰动时,$IoU_R$从54.6%降至34.2%,显示出类似的脆弱性。
- 在PGD攻击下,$\epsilon = 40$时,仅攻击RGB模态的$IoU_R$降至28.6%,仅攻击IR模态的$IoU_R$降至33.2%,确认了持续的脆弱性。
- 当两个模态同时被攻击时,模型的$IoU_R$最低(27.3%),表明融合并未带来鲁棒性增益。
- 尽管在干净输入下表现优异,该多模态融合模型在对抗鲁棒性方面未表现出显著提升,暗示互补特征未被充分利用。
- 结果表明,当前融合模型即使在多模态可用的情况下,仍依赖非鲁棒特征,从而削弱了互补智能在防御中的潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。