Skip to main content
QUICK REVIEW

[论文解读] Blockwise Self-Supervised Learning at Scale

Shoaib Ahmed Siddiqui, David Krueger|arXiv (Cornell University)|Feb 3, 2023
Domain Adaptation and Few-Shot Learning被引用 4
一句话总结

该论文提出一种分块自监督学习方法,通过在ResNet-50的每个层块上独立应用Barlow Twins的损失函数,在ImageNet上进行训练,实现了70.48%的top-1准确率,仅比端到端反向传播方法低1.1%。该方法同时训练各块,采用特征扩展池化策略,并注入高斯噪声以提升性能,表明局部学习规则可扩展至大规模模型,且性能损失极小。

ABSTRACT

Current state-of-the-art deep networks are all powered by backpropagation. In this paper, we explore alternatives to full backpropagation in the form of blockwise learning rules, leveraging the latest developments in self-supervised learning. We show that a blockwise pretraining procedure consisting of training independently the 4 main blocks of layers of a ResNet-50 with Barlow Twins' loss function at each block performs almost as well as end-to-end backpropagation on ImageNet: a linear probe trained on top of our blockwise pretrained model obtains a top-1 classification accuracy of 70.48%, only 1.1% below the accuracy of an end-to-end pretrained network (71.57% accuracy). We perform extensive experiments to understand the impact of different components within our method and explore a variety of adaptations of self-supervised learning to the blockwise paradigm, building an exhaustive understanding of the critical avenues for scaling local learning rules to large networks, with implications ranging from hardware design to neuroscience.

研究动机与目标

  • 探究在ImageNet等大规模数据集上,使用局部学习规则的分块训练是否能达到与端到端反向传播相当的性能。
  • 理解架构选择(如块顺序、池化策略和噪声注入)对分块自监督学习的影响。
  • 探索将局部学习规则扩展至深度网络的可行性,为神经科学和能效更高的硬件设计提供启示。
  • 确定在分块范式下,同时训练与顺序训练哪种方式更有利于表示学习。
  • 评估在分块自监督设置中,对早期块使用有监督目标进行预训练是否会影响整体网络性能。

提出的方法

  • 该方法在ResNet-50的四个主要块上独立应用Barlow Twins的自监督损失函数,通过对比表示学习对每个块进行孤立训练。
  • 各块同时训练而非顺序训练,通过前向传播路径保留块间信息流动。
  • 采用扩展池化策略,在应用损失前增加块输出的特征维度,这对成功训练至关重要。
  • 在每个块之前向激活值注入标准差σ = 0.25的高斯噪声,以提升泛化能力,使准确率提升约0.5%。
  • 使用投影网络将块输出映射到潜在空间,以便计算Barlow Twins损失,确保不变性与信息保留。
  • 该方法避免跨块反向传播,但保留了每个块内部及其层间(包括投影网络)的反向传播。

实验结果

研究问题

  • RQ1能否在ImageNet上通过使用局部损失函数的分块自监督学习,实现与端到端反向传播相近的性能?
  • RQ2在分块范式下,块的并行训练是否优于顺序训练,原因是什么?
  • RQ3不同的池化策略与特征维度扩展方式如何影响分块自监督学习的性能?
  • RQ4在分块自监督设置中,对低层块进行有监督预训练是否会降低整体网络性能?
  • RQ5噪声注入与自适应数据增强策略能否提升分块训练模型的表示质量?

主要发现

  • 分块自监督方法在ImageNet上的线性探测top-1准确率达到70.48%,仅比端到端反向传播训练的ResNet-50的71.57%低1.1%。
  • 块的并行训练显著优于顺序训练,准确率提升1.72%,表明前向路径中的块间交互对学习至关重要。
  • 在激活值中注入标准差σ = 0.25的高斯噪声使性能提升约0.5%,而更高噪声水平(σ = 0.5)则导致性能下降。
  • 通过池化扩展块输出的特征维度对成功训练至关重要,优于简单的平均池化或最大池化。
  • 对低层块进行有监督预训练会降低整体网络性能,表明早期层过早学习不变性会损害高层特征学习。
  • 将前两个块合并为单一块可提升最终准确率,表明过度细分块会降低性能,并限制完全局部学习的可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。