[论文解读] Adversarial Evaluation of Multimodal Models under Realistic Gray Box Assumption
本文提出了一种针对多模态(图像+文本)分类器的现实灰盒威胁模型,用于评估对抗鲁棒性,提出了一种利用对模型组件部分知识的双模态攻击方法。研究发现,图像与文本联合攻击在高达73%的Hateful Memes案例中引发误分类,超过单模态攻击;而仅图像攻击的效果优于基于字符级别的文本增强(错误率分别为45%与30%)。
This work examines the vulnerability of multimodal (image + text) models to adversarial threats similar to those discussed in previous literature on unimodal (image- or text-only) models. We introduce realistic assumptions of partial model knowledge and access, and discuss how these assumptions differ from the standard "black-box"/"white-box" dichotomy common in current literature on adversarial attacks. Working under various levels of these "gray-box" assumptions, we develop new attack methodologies unique to multimodal classification and evaluate them on the Hateful Memes Challenge classification task. We find that attacking multiple modalities yields stronger attacks than unimodal attacks alone (inducing errors in up to 73% of cases), and that the unimodal image attacks on multimodal classifiers we explored were stronger than character-based text augmentation attacks (inducing errors on average in 45% and 30% of cases, respectively).
研究动机与目标
- 研究在介于完全白盒与黑盒访问之间的现实威胁模型下,多模态分类器的对抗脆弱性。
- 评估当图像和文本模态同时受到对抗扰动时,多模态模型是否比单模态模型更具鲁棒性。
- 评估在不同模型访问和知识水平下,基于图像和基于文本的对抗攻击的有效性。
- 研究使用公开的现成组件(如预训练目标检测器)如何影响多模态系统中的对抗脆弱性。
- 量化不同对抗攻击策略——引导束搜索、随机搜索和迁移攻击——对多模态分类性能的影响。
提出的方法
- 开发了一种灰盒攻击框架,假设可部分访问模型组件,如特征提取器或现成模型(如Faster R-CNN和ResNet)。
- 使用特征匹配损失函数 $ L = ||f(x) - f(y)||_2 $ 生成对抗性图像,使特征图向标签相反但文本相同的目标图像偏移。
- 采用PGD优化方法,并在多个模型(如ResNet-152、DenseNet等)上进行集成平均,以提升在黑盒和灰盒设置下的攻击迁移能力。
- 将束搜索与编辑距离约束相结合,生成对抗性文本增强,以最小化语义偏差的同时最大化对正确类别的置信度下降。
- 基于编辑距离阈值(τ = 0.07, 0.2, 0.5)设定三种文本攻击级别——轻度、中度和重度,以控制扰动强度。
- 在白盒和轻度灰盒设置下进行文本攻击排序,当无法直接访问时,利用外部模型。
实验结果
研究问题
- RQ1与标准黑盒或白盒模型相比,多模态分类器在现实灰盒假设下的鲁棒性如何变化?
- RQ2在诱导误分类方面,对图像和文本模态的联合对抗攻击在多大程度上优于单模态攻击?
- RQ3与基于字符的文本增强攻击相比,基于图像的对抗攻击在欺骗多模态分类器方面的有效性如何?
- RQ4使用公开的预训练组件(如目标检测器)是否会增加多模态模型对对抗攻击的脆弱性?
- RQ5在相同威胁模型下,多模态融合机制的选择如何影响对抗鲁棒性?
主要发现
- 对图像和文本模态的联合对抗攻击在Hateful Memes数据集上使多模态分类器的欺骗成功率高达73%。
- 仅图像攻击导致45%的误分类,优于基于字符的文本增强攻击(导致30%的错误率)。
- 采用不同融合机制的多模态模型对对抗攻击表现出相似的脆弱性,表明融合策略对鲁棒性无显著影响。
- 依赖公开、未经微调的目标检测器的模型容易受到对抗攻击,表明公开可用组件可使较弱攻击者实施有效攻击。
- 对抗攻击的成功不依赖于所使用的具体融合机制,表明鲁棒性必须在输入层面解决,而不能仅通过架构选择实现。
- 与随机搜索相比,用于文本增强的引导束搜索在轻度和中度扰动水平下取得了更高的成功率,证实了在灰盒设置下查询引导搜索的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。