Skip to main content
QUICK REVIEW

[论文解读] Learning from Randomly Initialized Neural Network Features

Ehsan Amid, Rohan Anil|arXiv (Cornell University)|Feb 13, 2022
Neural Networks and Applications被引用 7
一句话总结

本文提出了神经网络先验核(Neural Network Prior Kernel, NNPK),一种基于随机初始化神经网络期望logits的理论基础坚实、无限维的核函数。研究证明,NNPK的有限样本近似——神经随机特征(Neural Random Features, NRF)——能够捕捉有意义的数据结构,并使线性分类器在无需任何训练的情况下实现优异性能,例如在ImageNet-1K上达到10.3%的top-1准确率,表明网络架构的归纳偏置在初始化时已存在。

ABSTRACT

We present the surprising result that randomly initialized neural networks are good feature extractors in expectation. These random features correspond to finite-sample realizations of what we call Neural Network Prior Kernel (NNPK), which is inherently infinite-dimensional. We conduct ablations across multiple architectures of varying sizes as well as initializations and activation functions. Our analysis suggests that certain structures that manifest in a trained model are already present at initialization. Therefore, NNPK may provide further insight into why neural networks are so effective in learning such structures.

研究动机与目标

  • 探究随机初始化的神经网络是否可在不进行任何训练的情况下作为有效的特征提取器。
  • 基于从先验分布π(θ)中抽取的所有权重实现的logits内积的期望,形式化定义一种新核函数——神经网络先验核(NNPK)。
  • 分析网络架构选择、权重初始化方式以及激活函数对通过NRF提取的特征质量的影响。
  • 探究在完全训练的模型中观察到的结构特性是否已在初始化时的随机特征表示中显现。

提出的方法

  • 将神经网络先验核(NNPK)定义为从先验分布π(θ)中抽取的所有权重实现下,logits内积的期望。
  • 构建NNPK的有限样本近似,称为神经随机特征(NRF),通过使用多个随机初始化的神经网络将输入样本映射到高维空间。
  • 在NRF表示上训练线性分类器,以评估其在下游分类任务中的性能。
  • 使用TriMap可视化与余弦相似度分析,比较NRF、原始输入以及完全训练模型中数据的几何结构。
  • 系统性地消融模型架构、初始化方案、激活函数及归一化层,以研究其对NRF质量的影响。
  • 将NRF应用于ImageNet-1K等大规模数据集,以评估其可扩展性与性能。

实验结果

研究问题

  • RQ1随机初始化的神经网络是否在未进行任何训练前即可提取反映有意义数据结构的特征?
  • RQ2神经网络先验核(NNPK)能否作为理解深度网络归纳偏置的理论基础?
  • RQ3跳连接和归一化层等架构组件在多大程度上影响通过NRF提取的特征质量?
  • RQ4在线性分类器在NRF上的性能与完全训练模型在相同数据集上的最终准确率之间是否存在相关性?

主要发现

  • 在4096个来自随机初始化ResNet-18模型的神经随机特征(NRF)上训练的线性分类器,在ImageNet-1K上达到了10.3%的top-1准确率,显著优于在原始输入特征(150K维)上训练的线性分类器的3.4%准确率。
  • 在31,568个NRF特征上训练的两层MLP在ImageNet-1K上达到了15.2%的top-1准确率,表明在NRF上使用简单模型可超越原始输入的性能。
  • TriMap可视化显示,完全训练的ResNet-18模型中观察到的聚类结构与类别接近性模式,已在NRF表示中显现,表明数据结构在初始化时已被复现。
  • 在线性分类器在NRF上的性能与完全训练模型的最终准确率之间存在强相关性,表明NRF可预测模型的可训练性。
  • 跳跃连接与ReLU激活函数可提升NRF质量,但最终训练模型的性能未必遵循相同趋势,表明NNPK在所有情况下无法完全预测泛化能力。
  • 批量归一化(BatchNorm)不影响NNPK,但其他归一化技术(如层归一化与实例归一化)的影响尚待探索。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。