Skip to main content
QUICK REVIEW

[论文解读] LieGG: Studying Learned Lie Group Generators

Artem Moskalev, Anna Sepliarskaia|arXiv (Cornell University)|Oct 9, 2022
Topological and Geometric Data Analysis被引用 6
一句话总结

本文提出 LieGG 方法,通过从可微模型和训练数据中计算无穷小李群生成元,以提取并分析神经网络中学习到的对称性。结果表明,更深、过参数化的网络在微调或逐层训练下,能在中间层学习到更精确且更稳定的对称性,且无需事先了解数据中的对称性。

ABSTRACT

Symmetries built into a neural network have appeared to be very beneficial for a wide range of tasks as it saves the data to learn them. We depart from the position that when symmetries are not built into a model a priori, it is advantageous for robust networks to learn symmetries directly from the data to fit a task function. In this paper, we present a method to extract symmetries learned by a neural network and to evaluate the degree to which a network is invariant to them. With our method, we are able to explicitly retrieve learned invariances in a form of the generators of corresponding Lie-groups without prior knowledge of symmetries in the data. We use the proposed method to study how symmetrical properties depend on a neural network's parameterization and configuration. We found that the ability of a network to learn symmetries generalizes over a range of architectures. However, the quality of learned symmetries depends on the depth and the number of parameters.

研究动机与目标

  • 开发一种无需事先知晓底层对称群信息即可揭示神经网络所学习对称性的方法。
  • 利用对称性方差和偏差等定量指标评估所学习对称性的质量与不变性。
  • 研究网络深度、宽度及训练策略如何影响所学习对称性的准确性与鲁棒性。
  • 通过揭示训练过程中隐式获得的几何归纳偏置,提升模型可解释性。

提出的方法

  • 该方法通过求解基于网络对数据变换梯度的矩阵零空间方程,提取所学习李群的无穷小生成元。
  • 利用李代数与李群的对应关系,对生成元进行指数映射,以恢复完整的连续对称变换。
  • 通过生成元的极化矩阵计算对称性方差与对称性偏差,以量化不变性质量。
  • 该方法应用于在旋转-MNIST 及其他具有受控变化因子的数据集上训练的前馈网络。
  • 支持对多种训练策略的分析,包括预训练、微调和逐层训练。
  • 该方法具有通用性,仅需模型可微,因此适用于任何神经网络架构。

实验结果

研究问题

  • RQ1在缺乏架构归纳偏置的情况下,神经网络在多大程度上能从数据中学习连续对称性?
  • RQ2所学习的对称性在多大程度上准确反映了数据中实际存在的对称性?
  • RQ3网络深度与参数量如何影响所学习对称性的精确性与不变性?
  • RQ4不同的训练策略(如微调或逐层训练)如何影响中间层对称性的学习?
  • RQ5我们能否量化并解释如 MLP 和 Transformer 等模型所学习到的几何归纳偏置?

主要发现

  • 相较于小型网络架构,更深且过参数化的网络能学习到更精确的对称群,且具有更高的不变性程度。
  • 采用不同训练策略训练的网络,其最后一层与倒数第二层收敛到相似的对称性水平,表明存在与任务相关的最优对称性不变性。
  • 中间层对训练策略表现出强烈依赖性:微调与逐层训练能提升对称性准确性,降低对称性方差与偏差。
  • 预训练子网络所学习的对称性比作为深层模型一部分时更准确,表明预训练有助于提升对称性学习能力。
  • 该方法在无需事先知晓变换集合的情况下成功恢复了所学习对称性的生成元,从而实现了对不变性质量的定量评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。