Skip to main content
QUICK REVIEW

[论文解读] Where Should I Spend My FLOPS? Efficiency Evaluations of Visual Pre-training Methods

Skanda Koppula, Yazhe Li|arXiv (Cornell University)|Sep 30, 2022
Domain Adaptation and Few-Shot Learning被引用 5
一句话总结

本文在固定FLOP预算下评估了视觉自监督预训练方法的计算效率,对比了六种方法(CLIP、DINO、SimCLR、BYOL、MAE、监督学习)在五个数据集和两种ViT主干网络尺寸下的表现。研究发现,CLIP和MAE在准确率-效率权衡上表现最佳,而未经筛选的数据集(如JFT-300M和COCO)尽管使用了大量FLOP,性能却显著更差,挑战了自监督学习在噪声数据上可有效扩展的假设。

ABSTRACT

Self-supervised methods have achieved remarkable success in transfer learning, often achieving the same or better accuracy than supervised pre-training. Most prior work has done so by increasing pre-training computation by adding complex data augmentation, multiple views, or lengthy training schedules. In this work, we investigate a related, but orthogonal question: given a fixed FLOP budget, what are the best datasets, models, and (self-)supervised training methods for obtaining high accuracy on representative visual tasks? Given the availability of large datasets, this setting is often more relevant for both academic and industry labs alike. We examine five large-scale datasets (JFT-300M, ALIGN, ImageNet-1K, ImageNet-21K, and COCO) and six pre-training methods (CLIP, DINO, SimCLR, BYOL, Masked Autoencoding, and supervised). In a like-for-like fashion, we characterize their FLOP and CO$_2$ footprints, relative to their accuracy when transferred to a canonical image segmentation task. Our analysis reveals strong disparities in the computational efficiency of pre-training methods and their dependence on dataset quality. In particular, our results call into question the commonly-held assumption that self-supervised methods inherently scale to large, uncurated data. We therefore advocate for (1) paying closer attention to dataset curation and (2) reporting of accuracies in context of the total computational cost.

研究动机与目标

  • 在固定FLOP预算下,确定最具有计算效率的视觉预训练方法。
  • 评估数据集质量与筛选对自监督学习效率和准确率的影响。
  • 从FLOP归一化准确率的角度,比较对比学习、自蒸馏和掩码自编码方法的性能。
  • 倡导在报告模型性能时,应结合总计算成本,而不仅关注准确率。

提出的方法

  • 在五个大规模数据集(JFT-300M、ALIGN、ImageNet-1K、ImageNet-21K和COCO)上预训练六种方法——CLIP、DINO、SimCLR、BYOL、MAE和监督分类。
  • 使用ViT-B和ViT-L主干网络,评估模型尺寸对FLOP效率的影响。
  • 在相同硬件上对每梯度步长的FLOP成本进行性能分析,以实现同类比较下的FLOP归一化。
  • 将所有模型微调至标准ViT结构的语义分割头,并在COCO-2017和COCO-2017目标检测基准上进行评估。
  • 针对MAE优化掩码比率(例如,在COCO上为65%,在其他数据集上为75%),以最大化下游任务的准确率与效率。
  • 报告结果时按FLOPs和CO2排放量进行归一化,以实现在方法、数据集和模型尺寸之间的公平比较。

实验结果

研究问题

  • RQ1在多样化数据集和模型尺寸下,哪种自监督预训练方法在单位FLOP下实现最高准确率?
  • RQ2数据集筛选程度(如ImageNet-1K与未经筛选的JFT-300M)如何影响自监督学习的效率与准确率?
  • RQ3在固定计算预算下,FLOP高效的模型在训练更大主干网络方面能实现多大程度的提升?
  • RQ4自监督方法的性能是否能可靠地随数据集规模增长而提升,还是高质量的数据筛选更为关键?
  • RQ5在相同FLOP约束下,CLIP和MAE的效率与准确率与监督预训练相比如何?

主要发现

  • CLIP在大规模数据集上实现了最佳的FLOP归一化准确率,在语义分割和目标检测任务中均优于或匹配监督预训练方法。
  • MAE表现出强劲的绝对性能,并在效率方面位居前列,尤其在ImageNet-1K和COCO上表现突出,语义分割mIoU达44.8,目标检测mAP达44.2。
  • 自监督方法如DINO、SimCLR和BYOL表现出显著更低的计算效率,达到相近性能所需FLOPs高达一个数量级。
  • 在未经筛选的数据集(如JFT-300M或COCO)上预训练,即使使用更高FLOP,性能也远低于在筛选过的ImageNet-1K/21K上训练的结果。
  • 在掩码自编码(MAE)中,解码器占用了主要计算时间,高达65%的前向-反向传播时间用于解码,尤其在高掩码比率下更为明显。
  • 在MAE中使用单层‘tiny’解码器,可在75%掩码比率下将运行时间减少95%,显著提升效率,且不损失准确率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。