[论文解读] Revisiting Weakly Supervised Pre-Training of Visual Perception Models
本文研究了利用大规模图像-标签对进行视觉感知模型的弱监督预训练,使用迄今为止最大的图像与标签配对数据集对现代ResNet架构进行训练。所提出的SWAG模型在迁移学习设置中达到最先进性能,优于自监督和完全监督基线模型,并展现出稳健的零样本泛化能力,且有害刻板印象风险极低。
Model pre-training is a cornerstone of modern visual recognition systems. Although fully supervised pre-training on datasets like ImageNet is still the de-facto standard, recent studies suggest that large-scale weakly supervised pre-training can outperform fully supervised approaches. This paper revisits weakly-supervised pre-training of models using hashtag supervision with modern versions of residual networks and the largest-ever dataset of images and corresponding hashtags. We study the performance of the resulting models in various transfer-learning settings including zero-shot transfer. We also compare our models with those obtained via large-scale self-supervised learning. We find our weakly-supervised models to be very competitive across all settings, and find they substantially outperform their self-supervised counterparts. We also include an investigation into whether our models learned potentially troubling associations or stereotypes. Overall, our results provide a compelling argument for the use of weakly supervised learning in the development of visual recognition systems. Our models, Supervised Weakly through hashtAGs (SWAG), are available publicly.
研究动机与目标
- 评估利用标签作为弱监督信号的预训练方法在大规模视觉任务中的有效性,作为完全监督或自监督预训练的可扩展替代方案。
- 评估在大规模图像-标签对上训练的模型在下游视觉任务中的泛化能力,包括零样本和少样本迁移设置。
- 调查此类模型是否从弱监督信号中学习到有害或刻板的关联。
- 将弱监督模型的性能与最先进的自监督和完全监督预训练方法进行比较。
提出的方法
- 在大规模图像-标签对数据集上对现代残差网络进行预训练,使用标准交叉熵损失进行多标签分类。
- 利用目前公开可用的最大规模图像-标签对数据集,将监督信号扩展至超越传统ImageNet规模的数据集。
- 通过在多个下游视觉基准上进行迁移学习来评估模型性能,包括零样本和少样本设置。
- 通过直接使用学习到的特征而无需在目标数据集上微调,实现零样本迁移。
- 使用UTK Faces数据集系统性地分析偏见,考察预测标签与肤色、年龄、性别及外貌种族等人口属性之间的关联。
- 对模型预测结果进行视觉和统计分析,以区分模型学习到的关联与数据分布中的伪影。
实验结果
研究问题
- RQ1利用标签进行弱监督预训练是否能在下游视觉任务中达到与完全监督和自监督预训练相当的性能?
- RQ2在不进行微调的情况下,弱监督模型在零样本和少样本迁移学习设置中的表现如何?
- RQ3这些模型在多大程度上学习到与性别、种族或年龄相关的有害或刻板印象关联?
- RQ4所观察到的关联是源于模型学习,还是评估数据集(特别是UTK Faces数据集)中的伪影?
- RQ5当在可比规模下训练时,弱监督模型的性能是否优于自监督模型?
主要发现
- 最佳SWAG模型在多种视觉感知任务中达到与最先进模型相当的性能,尽管其训练流程相对简单。
- SWAG模型在所有评估的迁移学习设置中显著优于自监督预训练基线,包括零样本和少样本迁移。
- 模型展现出强大的零样本泛化能力,在无需任何微调的情况下即可在下游分类任务中达到具有竞争力的准确率。
- 偏见分析显示存在一些刻板印象关联,例如在UTK Faces数据集中#mugshot与非裔个体相关联,但视觉和统计分析表明这更可能是数据伪影而非模型学习的结果。
- #mugshot与较深肤色的关联在数据中并不成立:模型更频繁地将#mugshot预测给肤色最浅的个体(Fitzpatrick 1型),表明该偏见源于评估数据集。
- 总体而言,有害关联的风险低于自然语言建模任务,表明弱监督预训练是完全监督或自监督方法的可行且稳健的替代方案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。