Skip to main content
QUICK REVIEW

[论文解读] Gradients as Features for Deep Representation Learning

Fangzhou Mu, Yingyu Liang|arXiv (Cornell University)|Apr 12, 2020
Domain Adaptation and Few-Shot Learning参考文献 45被引用 11
一句话总结

该论文提出了一种新颖的深度表征学习方法,利用模型参数相对于特定任务损失的每个样本梯度作为特征,将其与网络激活值结合在逻辑回归模型中。该方法基于神经正切核(NTK)理论,为微调提供了一种局部线性近似,并在无监督、自监督和迁移学习任务中实现了最先进性能,优于激活值仅用的基线模型和完整微调方法的关键设置。

ABSTRACT

We address the challenging problem of deep representation learning--the efficient adaption of a pre-trained deep network to different tasks. Specifically, we propose to explore gradient-based features. These features are gradients of the model parameters with respect to a task-specific loss given an input sample. Our key innovation is the design of a linear model that incorporates both gradient and activation of the pre-trained network. We show that our model provides a local linear approximation to an underlying deep model, and discuss important theoretical insights. Moreover, we present an efficient algorithm for the training and inference of our model without computing the actual gradient. Our method is evaluated across a number of representation-learning tasks on several datasets and using different network architectures. Strong results are obtained in all settings, and are well-aligned with our theoretical insights.

研究动机与目标

  • 通过利用预训练网络中与特定任务相关的梯度信息,提升深度表征学习的数据效率。
  • 通过将梯度特征整合到特征表示中,弥合表征学习与完全监督训练之间的性能差距。
  • 开发一种高效且可扩展的算法,用于训练和推理,而无需显式计算梯度。
  • 基于神经正切核(NTK)理论,从理论上证明该方法是微调的局部线性近似。
  • 在多种任务、数据集和网络架构上,通过实证验证该方法的有效性。

提出的方法

  • 该方法构建一个线性模型,联合使用来自预训练深度网络的激活特征和梯度特征。
  • 梯度特征被定义为模型参数相对于每个输入样本的任务特定损失的梯度。
  • 该模型在理论上被证明是微调的局部线性近似,其推导基于有限宽度网络的神经正切核(NTK)理论。
  • 设计了一种高效算法,通过反向传播隐式计算梯度,从而在无需显式计算梯度的情况下实现模型的训练和推理。
  • 该框架具有通用性,适用于视觉、自然语言处理和语音任务,评估重点集中于视觉表征学习。
  • 该方法将激活特征与梯度特征结合在单一线性分类器中,从而在判别能力上优于仅使用激活特征的基线模型。

实验结果

研究问题

  • RQ1预训练网络的每个样本梯度能否作为下游任务的有效且具有判别力的特征?
  • RQ2将梯度特征与激活特征结合,相较于单独使用任一特征,性能提升程度如何?
  • RQ3所提出方法在多大程度上近似于完整微调的性能?
  • RQ4该方法在不同预训练范式(无监督、自监督、迁移学习)下的性能表现如何?
  • RQ5该方法能否在不显式计算梯度的情况下实现具有竞争力的结果,同时保持可扩展性?

主要发现

  • 在所有评估的任务和数据集中,该方法显著优于标准的基于激活值的逻辑回归分类器。
  • 在CIFAR-10数据集上使用拼图(jigsaw)预训练任务时,该方法达到70.5%的准确率,超过基线模型,展现出强大的泛化能力。
  • 在VOC07和COCO2014上的迁移学习任务中,该方法分别比微调方法高出+0.8%和+3.0%,表明在语义对齐任务中具有更优性能。
  • 仅使用梯度的线性分类器表现具有竞争力,通常在无监督设置下与同时使用激活和梯度特征的完整模型表现相当或更优。
  • 该方法在多种网络架构(包括ResNet和BiGAN编码器)上均保持强性能,证明了其广泛适用性。
  • 实验结果与理论分析高度一致,证实了该模型作为微调的局部线性近似,符合NTK理论的预测。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。