[论文解读] An exact mapping between the Variational Renormalization Group and Deep Learning
本文建立了统计物理中的变分重整化群(VRG)与基于限制玻尔兹曼机(RBMs)的深度学习架构之间的精确数学映射。它表明,深度神经网络自然实现了类似于卡达诺夫块自旋重整化的广义粗粒化过程,揭示了深度学习在特征提取方面的成功可能源于其内在的重整化类似结构,该结论在1D模型中得到了解析验证,在2D伊辛模型中通过数值方法得到支持。
Deep learning is a broad set of techniques that uses multiple layers of representation to automatically learn relevant features directly from structured data. Recently, such techniques have yielded record-breaking results on a diverse set of difficult machine learning tasks in computer vision, speech recognition, and natural language processing. Despite the enormous success of deep learning, relatively little is understood theoretically about why these techniques are so successful at feature learning and compression. Here, we show that deep learning is intimately related to one of the most important and successful techniques in theoretical physics, the renormalization group (RG). RG is an iterative coarse-graining scheme that allows for the extraction of relevant features (i.e. operators) as a physical system is examined at different length scales. We construct an exact mapping from the variational renormalization group, first introduced by Kadanoff, and deep learning architectures based on Restricted Boltzmann Machines (RBMs). We illustrate these ideas using the nearest-neighbor Ising Model in one and two-dimensions. Our results suggests that deep learning algorithms may be employing a generalized RG-like scheme to learn relevant features from data.
研究动机与目标
- 理解深度学习在无监督特征学习和数据压缩中取得成功背后的理论基础。
- 研究深度神经网络(DNNs)是否执行一种类似于统计物理中重整化群(RG)的迭代粗粒化过程。
- 在变分重整化群(VRG)与基于限制玻尔兹曼机(RBMs)的深度学习架构之间建立精确的映射关系。
- 证明在自旋系统上训练的DNN会自组织成类似于卡达诺夫块自旋重整化的结构。
- 探索高级RG技术中的概念——如固定点、普适性和纠缠——在多大程度上可被用于启发或改进深度学习模型。
提出的方法
- 在卡达诺夫最初提出的变分重整化群(VRG)框架与基于限制玻尔兹曼机(RBMs)的深度学习模型之间建立精确映射。
- 在VRG中使用变分程序,以最小化物理系统与粗粒化系统之间的自由能差,类似于在RBMs中最小化Kullback-Leibler散度。
- 将该映射应用于一维和二维最近邻伊辛模型,一维情况采用解析方法,二维情况则通过堆叠RBMs进行数值训练。
- 通过权重矩阵的递归卷积定义有效感受野,追踪可见层自旋如何影响隐藏层神经元。
- 使用对比发散法结合L1正则化和动量项训练堆叠RBMs,以在伊辛模型数据上优化无监督特征学习。
- 可视化有效感受野,确认深层隐藏单元对可见层中更大区域的信息实现整合,从而模拟RG粗粒化过程。
实验结果
研究问题
- RQ1变分重整化群与基于限制玻尔兹曼机(RBMs)的深度学习架构之间是否存在精确的数学对应关系?
- RQ2在无监督学习中使用的深度神经网络是否执行一种类似于统计物理中重整化群的迭代粗粒化过程?
- RQ3深度网络中的特征学习过程是否可被解释为一种保留长程物理特性的广义重整化群变换?
- RQ4深度网络中学习到的表征与伊辛模型中卡达诺夫块自旋变换生成的表征相比有何异同?
- RQ5高级RG概念——如固定点、普适性和纠缠熵——在多大程度上可被迁移以改进或理解深度学习模型?
主要发现
- 在变分重整化群与基于限制玻尔兹曼机(RBMs)的深度学习架构之间存在精确的一对一映射。
- 在1D伊辛模型上训练的深度神经网络精确再现了卡达诺夫块自旋变换,证实了理论映射的正确性。
- 在2D伊辛模型中,堆叠RBMs自组织实现了一种与卡达诺夫块自旋重整化极为相似的粗粒化过程,这一结论由有效感受野的结构所证实。
- 隐藏单元的有效感受野随网络深度增加而逐步扩大,表明深层网络对可见层中更大空间区域的信息实现整合。
- 深度网络中学习到的权重矩阵呈现出分层结构,每一层捕获越来越抽象的长程关联,与RG中相关算符的演化流程相吻合。
- 训练过程中使用L1正则化可防止全连接耦合,强制实现稀疏性,从而维持有意义的粗粒化层次结构,与RG原理一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。