[论文解读] Understanding Zero-Shot Adversarial Robustness for Large-Scale Models
本文提出了一种文本引导的对比对抗训练损失(TeCoA),以增强CLIP等大规模视觉-语言模型中的零样本对抗鲁棒性。通过在微调过程中利用对比学习将对抗性视觉特征与正确文本嵌入对齐,TeCoA 在不损害零样本泛化能力的前提下提升了鲁棒性,在15个数据集上平均准确率较CLIP提升31分。
Pretrained large-scale vision-language models like CLIP have exhibited strong generalization over unseen tasks. Yet imperceptible adversarial perturbations can significantly reduce CLIP's performance on new tasks. In this work, we identify and explore the problem of \emph{adapting large-scale models for zero-shot adversarial robustness}. We first identify two key factors during model adaption -- training losses and adaptation methods -- that affect the model's zero-shot adversarial robustness. We then propose a text-guided contrastive adversarial training loss, which aligns the text embeddings and the adversarial visual features with contrastive learning on a small set of training data. We apply this training loss to two adaption methods, model finetuning and visual prompt tuning. We find that visual prompt tuning is more effective in the absence of texts, while finetuning wins in the existence of text guidance. Overall, our approach significantly improves the zero-shot adversarial robustness over CLIP, seeing an average improvement of over 31 points over ImageNet and 15 zero-shot datasets. We hope this work can shed light on understanding the zero-shot adversarial robustness of large-scale models.
研究动机与目标
- 为解决在CLIP等大规模视觉-语言模型中实现零样本对抗鲁棒性的挑战,其中标准对抗训练会损害零样本泛化能力。
- 研究训练损失和微调方法如何影响基础模型的零样本对抗鲁棒性。
- 开发一种方法,在显著提升对不可察觉对抗扰动的鲁棒性的同时,保持CLIP的零样本能力。
- 为视觉-语言模型的零样本对抗鲁棒性建立新基准。
提出的方法
- 提出一种文本引导的对比对抗训练损失(TeCoA),通过对比学习最大化对抗性视觉特征与正确文本嵌入之间的相似性。
- 在模型微调和视觉提示微调(VPT)过程中应用TeCoA,实现在不重新训练整个模型的前提下实现鲁棒性提升。
- 使用少量标注数据生成对抗样本,并通过对比损失将这些样本的特征与对应文本嵌入对齐。
- 通过使用CLIP从文本描述中检索伪标签,将TeCoA扩展至无标签数据,实现在大规模无标签数据上进行鲁棒训练。
- 采用双重优化循环:首先在对比损失上通过梯度攻击生成对抗样本,然后通过梯度下降更新模型参数。
- 使用标记级别的视觉提示,将可学习嵌入注入输入序列,其效果优于图像级别的像素级提示。
实验结果
研究问题
- RQ1不同的微调方法——微调与视觉提示微调——如何影响CLIP的零样本对抗鲁棒性?
- RQ2一种将对抗性视觉特征与文本嵌入对齐的对比损失,是否能在不降低泛化能力的前提下提升零样本鲁棒性?
- RQ3文本指导的存在与否如何影响对抗微调的有效性?
- RQ4TeCoA能否有效应用于无标签数据,以实现最小监督下的鲁棒性扩展?
主要发现
- 与CLIP相比,TeCoA在15个零样本数据集上平均提升了31分的对抗鲁棒性。
- 在缺乏文本指导的情况下,视觉提示微调(VPT)优于微调,以更少的参数实现了更好的鲁棒性。
- 当存在文本指导时,使用TeCoA的微调相比VPT获得更高的性能增益,因为更新了更多参数。
- 该方法在显著提升鲁棒性的同时,保持了CLIP强大的零样本泛化能力,避免了标准对抗训练中常见的性能权衡。
- TeCoA在HateMemes上达到54%的准确率,在PCAM上达到52.5%,接近随机猜测,表明在分布外任务中存在领域偏移挑战。
- 该方法可泛化至无标签数据,仅通过图像-文本相似性实现伪标签化,即可实现鲁棒性提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。