Skip to main content
QUICK REVIEW

[论文解读] On the emergence of simplex symmetry in the final and penultimate layers of neural network classifiers

E Weinan, Stephan Wojtowytsch|arXiv (Cornell University)|Dec 10, 2020
Neural Networks and Applications被引用 6
一句话总结

本文通过将高度表达的深度网络建模为有界可测函数,从理论角度解释了训练后的神经网络分类器在最后一层和倒数第二层中出现单纯形对称性的原因。结果表明,在交叉熵损失与范数约束下,最优解迫使每个类别的数据在倒数第二层坍缩为一个点,形成正则单纯形;而浅层网络无法实现这种坍缩,表明深度使这种几何简化成为可能。

ABSTRACT

A recent numerical study observed that neural network classifiers enjoy a large degree of symmetry in the penultimate layer. Namely, if $h(x) = Af(x) +b$ where $A$ is a linear map and $f$ is the output of the penultimate layer of the network (after activation), then all data points $x_{i, 1}, \dots, x_{i, N_i}$ in a class $C_i$ are mapped to a single point $y_i$ by $f$ and the points $y_i$ are located at the vertices of a regular $k-1$-dimensional standard simplex in a high-dimensional Euclidean space. We explain this observation analytically in toy models for highly expressive deep neural networks. In complementary examples, we demonstrate rigorously that even the final output of the classifier $h$ is not uniform over data samples from a class $C_i$ if $h$ is a shallow network (or if the deeper layers do not bring the data samples into a convenient geometric configuration).

研究动机与目标

  • 从理论上解释为何神经网络分类器中每个类别的数据在倒数第二层坍缩为单一点,形成正则单纯形。
  • 证明在高度表达网络中,这种单纯形对称性是范数约束与交叉熵损失下的最优解。
  • 与浅层网络进行对比,表明在相同训练动态下,浅层网络在最后一层无法实现类别坍缩。
  • 阐明深度在促成神经网络坍缩几何结构(尤其是倒数第二层)中的几何作用。
  • 确立最后一层输出并非均匀映射到类别顶点,除非先前层中已存在有利的几何构型。

提出的方法

  • 将倒数第二层输出建模为 $ L^∞(\mathbb{P}; \mathbb{R}^m) $ 中的有界可测函数,以表示高度表达的深度网络。
  • 对分类器输出施加 $ \ell^p $-范数约束,以确保在交叉熵损失下最小化解的存在性。
  • 分析在范数边界下软max交叉熵泛函的最小化,表明最优解导致类别坍缩至单纯形顶点。
  • 使用连续时间梯度流动力学研究收敛行为,尤其关注浅层网络情形。
  • 构造具有非凸输入类结构的显式反例,表明除非存在有利几何构型,否则浅层网络无法实现类别坍缩。
  • 应用平均场分析,并考虑梯度流下的参数动力学,以证明最后一层输出的非均匀收敛。

实验结果

研究问题

  • RQ1为何在深度神经网络分类器的倒数第二层中,同一类别的数据点会坍缩为单一点?
  • RQ2在何种条件下,分类器最后一层输出在同类别数据点上趋于一致?
  • RQ3为何在使用交叉熵损失训练的浅层网络中,这种坍缩为正则单纯形的现象不会发生?
  • RQ4倒数第二层的几何构型如何影响深度网络中最后一层的输出?
  • RQ5范数约束与损失函数结构在诱导最后一层和倒数第二层单纯形对称性方面起到何种作用?

主要发现

  • 在 $ \ell^p $-范数约束与交叉熵损失下,最优分类器将类别 $ C_i $ 中的所有数据点映射到单一点 $ y_i $,在倒数第二层形成正则单纯形。
  • 单纯形的顶点 $ y_i $ 到质心的距离相等,且彼此夹角相等,满足神经网络坍缩的条件。
  • 对于浅层网络,即使在最优参数下,最后一层输出 $ h(x) $ 也不会在连续时间梯度下降下收敛到每个类别的单一值。
  • 最后一层的几何结构依赖于 $ \ell^p $-范数的选择,但倒数第二层的几何结构在给定约束下对范数选择具有鲁棒性。
  • 在包含三个离散数据点且类结构非凸的反例中,仅当 $ p_3 = 2p_1 $ 时,最后一层输出差值 $ h(1) - h(-1) $ 才收敛至零,表明类别坍缩并非在无有利几何构型时自动发生。
  • 分析表明,最后一层的类别坍缩并非损失函数的固有属性,而是依赖于倒数第二层中预先存在的几何简化,意味着深度使这种结构成为可能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。