Skip to main content
QUICK REVIEW

[论文解读] Why Unsupervised Deep Networks Generalize

Anita de Mello Koch, Ellen De Mello Koch|arXiv (Cornell University)|Dec 7, 2020
Neural Networks and Applications参考文献 27被引用 7
一句话总结

本文提出,无监督深度网络之所以泛化性能良好,是因为其隐式执行了重正化群(RG)变换,通过丢弃数据中的高频(高动量)模式实现,类似于统计场论中通过减少自由度来实现的过程。通过分析训练后RBM和自编码器的奇异向量,作者发现大奇异值对应于低傅里叶模式,证实了RG类行为,并提出一种基于RG思想的网络初始化方法(RGM),使训练时间减少4–100倍,同时达到接近完整训练的性能。

ABSTRACT

Promising resolutions of the generalization puzzle observe that the actual number of parameters in a deep network is much smaller than naive estimates suggest. The renormalization group is a compelling example of a problem which has very few parameters, despite the fact that naive estimates suggest otherwise. Our central hypothesis is that the mechanisms behind the renormalization group are also at work in deep learning, and that this leads to a resolution of the generalization puzzle. We show detailed quantitative evidence that proves the hypothesis for an RBM, by showing that the trained RBM is discarding high momentum modes. Specializing attention mainly to autoencoders, we give an algorithm to determine the network's parameters directly from the learning data set. The resulting autoencoder almost performs as well as one trained by deep learning, and it provides an excellent initial condition for training, reducing training times by a factor between 4 and 100 for the experiments we considered. Further, we are able to suggest a simple criterion to decide if a given problem can or can not be solved using a deep network.

研究动机与目标

  • 为了解决深度学习中的泛化之谜,即参数数量远超训练样本的网络仍能良好泛化的问题。
  • 探究重正化群(RG)机制是否构成了深度网络泛化行为的内在原理。
  • 基于RG原理,开发一种数据驱动的深度网络初始化方法,以提升训练效率。
  • 建立一种基于RG分析的判据,用于判断给定问题是否可由深度网络求解。

提出的方法

  • 对训练后RBM和自编码器的权重矩阵执行奇异值分解(SVD),以分析学习表征的结构。
  • 使用二维离散傅里叶变换(DFT)分析奇异向量的频率成分,重点通过径向平均评估其在低或高动量模式上的支持程度。
  • 通过从数据中直接应用粗粒化规则推导网络参数,构建一种基于RG思想的初始化方法(RGM),以模拟自旋块变换。
  • 使用MNIST、Fashion-MNIST和伊辛模型数据,将RGM初始化的网络与标准训练方法进行性能和训练速度对比。
  • 对自旋块变换矩阵执行SVD,以证明RG粗粒化与深度网络中学习到的权重矩阵之间的等价性。
  • 利用噪声稳定性与奇异值衰减作为有效参数数量和泛化能力的指标。

实验结果

研究问题

  • RQ1训练后的深度网络是否通过丢弃数据中的高频分量,执行类似重正化群的变换?
  • RQ2深度网络的泛化能力是否可通过RG类模式抑制导致的有效参数数量减少来解释?
  • RQ3使用基于RG思想的方法(RGM)初始化深度网络,是否能显著减少训练时间,同时保持性能?
  • RQ4能否基于傅里叶模式支持提出一个简单判据,用以预测问题是否可由深度网络求解?
  • RQ5训练后权重矩阵的奇异向量与已知RG变换的本征模式之间是否存在定量对应关系?

主要发现

  • 训练后的RBM表现出RG类行为:与大奇异值相关的奇异向量集中在低傅里叶模式,表明高频(高动量)分量被抑制。
  • 隐层奇异向量通过从可见层向量中丢弃高频模式获得,证实了粗粒化过程的存在。
  • RGM初始化方法使MNIST的训练时间减少4倍,Fashion-MNIST减少10倍,更复杂数据(如花卉数据集)减少高达100倍,且性能几乎与完整训练相当。
  • 与小奇异值相关的奇异向量分布在所有傅里叶模式上,表明其对有效泛化无贡献。
  • 当通过SVD分解自旋块变换矩阵时,其表现出与训练后深度网络相同的低频支持和模式丢弃行为,证实了理论上的等价性。
  • 本研究建立了深度学习泛化与RG理论之间的定量联系,表明有效参数数量由大奇异值的数量决定,而非总参数数量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。