Skip to main content
QUICK REVIEW

[论文解读] Synergy and Symmetry in Deep Learning: Interactions between the Data, Model, and Inference Algorithm

Lechao Xiao, Jeffrey Pennington|arXiv (Cornell University)|Jul 11, 2022
Domain Adaptation and Few-Shot Learning被引用 4
一句话总结

本文指出,数据、模型与推理算法之间的协同作用——尤其是对称性相容性——使得深度学习能够克服维度灾难。研究证明,当数据、模型与优化算法中的对称性对齐时,学习效率随数据量增加而提升,揭示了一种‘数据提升数据效率’(DIDE)效应,即数据规模扩大可增强模型泛化能力。

ABSTRACT

Although learning in high dimensions is commonly believed to suffer from the curse of dimensionality, modern machine learning methods often exhibit an astonishing power to tackle a wide range of challenging real-world learning problems without using abundant amounts of data. How exactly these methods break this curse remains a fundamental open question in the theory of deep learning. While previous efforts have investigated this question by studying the data (D), model (M), and inference algorithm (I) as independent modules, in this paper, we analyze the triplet (D, M, I) as an integrated system and identify important synergies that help mitigate the curse of dimensionality. We first study the basic symmetries associated with various learning algorithms (M, I), focusing on four prototypical architectures in deep learning: fully-connected networks (FCN), locally-connected networks (LCN), and convolutional networks with and without pooling (GAP/VEC). We find that learning is most efficient when these symmetries are compatible with those of the data distribution and that performance significantly deteriorates when any member of the (D, M, I) triplet is inconsistent or suboptimal.

研究动机与目标

  • 理解现代深度学习系统如何在高输入维度下打破维度灾难。
  • 探究数据、模型架构与推理算法中的对称性作为学习效率统一原理的作用。
  • 分析数据分布、模型归纳偏置与优化动力学之间的相互作用,以缓解样本复杂度问题。
  • 识别在何种条件下学习效率随数据量增加而提升,从而挑战经典统计学习理论的边界。

提出的方法

  • 分析四种典型深度学习架构:全连接网络(FCN)、局部连接网络(LCN),以及采用向量化(VEC)与全局平均池化(GAP)读出的卷积网络。
  • 利用无限宽度极限研究模型与推理算法的对称性,从而实现对归纳偏置的可 tractable 理论分析。
  • 提出一种基于对称性的框架,用于评估数据分布对称性(如 O(3)^d 旋转对称性)、模型对称性与优化诱导归纳偏置之间的一致性。
  • 通过在对称性破坏扰动下(如旋转 ImageNet 输入)的实证评估,测量数据效率并检测函数类的转变。
  • 通过测量随训练数据增加而变化的缩放律斜率(α)来量化 DIDE(数据提升数据效率)效应。
  • 使用维度计数法估算克服虚假对称性(如 O(3)^d 或 O(3d))所需的训练样本数量。

实验结果

研究问题

  • RQ1数据、模型与推理算法中的对称性如何共同影响高维深度学习中的学习效率?
  • RQ2在何种条件下增加训练数据可提升数据效率?其根本原因是什么?
  • RQ3数据分布与模型架构之间的对称性相容性在泛化中起到何种作用?
  • RQ4深度学习系统能否克服如 O(3)^d 这类虚假对称性?若能,需要多少样本才能实现?
  • RQ5SGD 的隐式偏差如何与模型和数据对称性相互作用,从而塑造泛化性能?

主要发现

  • 在 ImageNet 上使用 SGD 训练的最优学习系统(ResNet101)表现出 α ≈ 0.41 的幂律缩放,表明其具有高数据效率。
  • 当数据对称性被破坏时(如将 ImageNet 输入按 O(3)^d 旋转),学习曲线在约 2×10⁵ 个样本处出现尖点,此后缩放斜率显著提升至 α ≈ 0.49。
  • 在尖点后的第二阶段,ResNet101 和 Mixer 模型分别实现 α ≈ 0.49 和 0.38,接近最优基线性能。
  • 当在 O(3)^d 旋转的 ImageNet 上训练时,ResNet 家族将 top-1 准确率差距从 ~10%(ResNet-18)减少至 ~6%(ResNet-200),表明对对称性破坏具有更强鲁棒性。
  • 在相同旋转条件下,EfficientNet 家族将准确率差距从 ~4%(B0)减少至 ~1%(B7),表明更宽更深的模型能更有效地克服虚假对称性。
  • 估算得出克服 O(3)^d 对称性所需的样本数量约为 ~10¹⁰,与对称群维度的维度计数结果一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。