[论文解读] Masked Unsupervised Self-training for Label-free Image Classification
本文提出掩码无监督自训练(MUST),一种通过在无标签数据上联合优化伪标签生成与掩码图像建模,从而提升CLIP等零样本视觉模型性能的无监督微调方法。MUST在ViT-B模型上于ImageNet上达到77.7%的top-1准确率,相较于CLIP的零样本性能提升9.4%,相较于16-shot有监督微调提升6.2%。
State-of-the-art computer vision models are mostly trained with supervised learning using human-labeled images, which limits their scalability due to the expensive annotation cost. While self-supervised representation learning has achieved impressive progress, it still requires a second stage of finetuning on labeled data. On the other hand, models pre-trained with large-scale text-image supervision (e.g., CLIP) have enabled zero-shot transfer to downstream image classification tasks. However, the zero-shot performance of CLIP-like models are often insufficient for real-world adoption. In this paper, we aim to leverage the abundant unlabeled data from a target domain to improve the performance of a pre-trained zero-shot classifier, by unsupervised finetuning of the pre-trained model. We propose Masked Unsupervised Self-Training (MUST), a new unsupervised adaptation method which leverages two different and complementary sources of training signals: pseudo-labels and raw images. MUST jointly optimizes three objectives to learn both class-level global feature and pixel-level local feature and enforces a regularization between the two. We demonstrate the efficacy of MUST on a variety of downstream tasks, where it improves upon CLIP by a large margin. MUST also outperforms supervised few-shot adaptation methods. It achieves a top-1 accuracy of 77.7% on ImageNet using ViT-B, +9.4% higher than CLIP, and +6.2% higher than 16-shot CLIP adaptation. Our code is available at https://github.com/salesforce/MUST.
研究动机与目标
- 解决CLIP类模型在零样本性能上的差距,尽管其具备可扩展性,但性能常低于有监督模型。
- 利用下游领域中丰富的无标签数据,在无需人工标注的情况下提升预训练的零样本分类器性能。
- 通过结合两种监督信号,克服自训练(依赖噪声伪标签)与自监督学习(需下游微调)的局限性。
- 开发一个统一框架,通过正则化目标将全局类别级特征与局部像素级表征对齐。
- 通过纯无监督微调实现高性能,推动视觉模型在低资源标注场景下的实际部署。
提出的方法
- MUST在目标领域仅使用无标签图像,对预训练的零样本分类器(如CLIP)进行无监督微调。
- 它联合优化三个目标:(1) 使用教师模型生成的伪标签进行自训练,(2) 掩码图像建模(MAE风格)以重建被掩码的图像块,(3) 全局-局部表征对齐,以正则化表示学习。
- 自训练目标采用一致性正则化与熵最小化,以在扰动输入上生成置信且清晰的预测。
- 掩码图像建模目标训练模型重建缺失的图像块,增强局部特征学习。
- 全局-局部对齐目标强制全局分类头与局部表征之间建立结构化关系,提升特征质量。
- 采用指数移动平均(EMA)更新策略对学生模型的在线网络进行稳定训练。
实验结果
研究问题
- RQ1在不使用任何标注数据的前提下,结合伪标签生成与掩码图像建模是否能提升零样本分类性能?
- RQ2所提出的全局-局部表征对齐目标相较于单独使用任一监督信号,如何增强模型泛化能力?
- RQ3通过MUST进行无监督微调,能在多大程度上弥合零样本与完全有监督模型之间的性能差距?
- RQ4与标准微调或CLIP的零样本性能相比,MUST是否在分布偏移下表现出更强的鲁棒性?
- RQ5在ImageNet-R与ImageNet-A等分布外数据集上,使用MUST的归纳学习能否进一步提升鲁棒性?
主要发现
- MUST在ViT-B模型上于ImageNet上达到77.7%的top-1准确率,相较于CLIP的零样本性能提升9.4%。
- 在同一基准上,MUST相较于CLIP的16-shot有监督微调提升6.2个百分点。
- 在ImageNet-V2上,MUST相较于CLIP准确率提升7.0%,表明其在自然分布偏移下具有更强的泛化能力。
- 采用ImageNet预热的归纳MUST在ImageNet-R上达到87.6%的准确率,相较于CLIP提升9.9%,显示出对分布偏移的强鲁棒性。
- 大量消融实验表明,伪标签生成与掩码图像建模均对性能有显著贡献,且对齐目标进一步带来增益。
- 尽管在微调阶段未使用任何标注数据,MUST在某些基准上的性能已可媲美完全有监督方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。