[论文解读] Optimizing Relevance Maps of Vision Transformers Improves Robustness
本文提出一种微调方法,通过优化视觉变换器(ViTs)的相关性图,使模型注意力更聚焦于前景物体而非背景,从而提升对领域分布偏移的鲁棒性。仅使用少量成对的图像与前景掩码(通过自监督ViT自动生成),三种损失项共同促使背景相关性降低、前景覆盖范围更广、预测置信度更高,从而在不损失原始准确率的前提下,显著提升模型在分布外数据集上的准确率。
It has been observed that visual classification models often rely mostly on the image background, neglecting the foreground, which hurts their robustness to distribution changes. To alleviate this shortcoming, we propose to monitor the model's relevancy signal and manipulate it such that the model is focused on the foreground object. This is done as a finetuning step, involving relatively few samples consisting of pairs of images and their associated foreground masks. Specifically, we encourage the model's relevancy map (i) to assign lower relevance to background regions, (ii) to consider as much information as possible from the foreground, and (iii) we encourage the decisions to have high confidence. When applied to Vision Transformer (ViT) models, a marked improvement in robustness to domain shifts is observed. Moreover, the foreground masks can be obtained automatically, from a self-supervised variant of the ViT model itself; therefore no additional supervision is required.
研究动机与目标
- 解决ViTs因数据集偏差和虚假相关性而过度依赖背景线索的问题。
- 通过操控注意力机制使模型聚焦于前景物体,提升对分布偏移的鲁棒性。
- 开发一种微调方法,仅需极少人工标注数据,利用自监督生成的前景掩码替代人工标注。
- 在提升模型对分布外数据泛化能力的同时,保持其在原始训练分布上的高分类准确率。
- 提供一种事后、与模型无关的方法,以提升基于ViT的分类器的可解释性与鲁棒性。
提出的方法
- 对预训练ViT应用微调过程,使用少量图像-掩码对,包含三个独立的损失组件。
- 第一种损失最小化分配给背景区域的相关性分数,以促进模型关注物体本身。
- 第二种损失鼓励相关性图中更广泛的前景覆盖,减少稀疏激活现象。
- 第三种损失作为正则项,以保持原始模型在训练分布上的分类准确率。
- 前景掩码通过一种自监督ViT变体获得,无需人工标注掩码。
- 该方法为训练后处理,无需从头开始训练或修改网络架构。
实验结果
研究问题
- RQ1优化ViTs的相关性图是否能减少对背景线索的依赖,并提升对领域分布偏移的鲁棒性?
- RQ2少量图像-掩码对在不降低域内性能的前提下,能在多大程度上提升模型泛化能力?
- RQ3自监督前景掩码生成在无需人工标注的情况下,其有效性如何?
- RQ4该方法的失败案例是什么?其与物体大小、上下文依赖性或类别稀有性有何关联?
- RQ5该方法是否通过使注意力图更贴近人类识别的物体区域,从而提升可解释性?
主要发现
- 该方法显著提升了模型在分布外数据集(如ImageNet-A、ImageNet-R、ImageNet-Sketch和SI-Score)上的分类准确率,尤其在领域偏移基准上表现突出。
- 在ImageNet-A(高度分布外的测试集)上,该方法在保持高预测置信度的同时增强了模型鲁棒性。
- 微调后模型生成的相关性图在聚焦前景物体方面有显著改善,背景主导现象明显减少。
- 对于小物体或依赖上下文的物体类别,该方法带来最大性能提升,尤其当原始模型依赖背景线索时效果更明显。
- 该方法在原始ImageNet数据集上仅造成极小的准确率下降,证明其对域内性能的保持能力出色。
- 失败案例有限,通常出现在稀有类别或前景模糊的情况下,例如带有干扰前景物体的池桌,或相似犬种(如泰迪犬与迷你贵宾犬)的混淆。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。