Skip to main content
QUICK REVIEW

[论文解读] Imbalance Trouble: Revisiting Neural-Collapse Geometry

Christos Thrampoulidis, Ganesh Ramachandra Kini|arXiv (Cornell University)|Aug 10, 2022
Imbalanced Data Classification Techniques被引用 13
一句话总结

本文提出了一种类不平衡不变的神经坍缩几何推广——单纯形编码标签插值(SELI),证明在交叉熵损失下且正则化趋近于零时,无论类别分布如何不均衡,嵌入和分类器始终插值于一个单纯形编码的标签矩阵。该几何结构完全由该标签矩阵的奇异值分解(SVD)决定,其范数与夹角可显式地由类别不均衡比率和类别数量表征,从而在类别不均衡数据下提供了模型几何的统一、封闭形式描述。

ABSTRACT

Neural Collapse refers to the remarkable structural properties characterizing the geometry of class embeddings and classifier weights, found by deep nets when trained beyond zero training error. However, this characterization only holds for balanced data. Here we thus ask whether it can be made invariant to class imbalances. Towards this end, we adopt the unconstrained-features model (UFM), a recent theoretical model for studying neural collapse, and introduce Simplex-Encoded-Labels Interpolation (SELI) as an invariant characterization of the neural collapse phenomenon. Specifically, we prove for the UFM with cross-entropy loss and vanishing regularization that, irrespective of class imbalances, the embeddings and classifiers always interpolate a simplex-encoded label matrix and that their individual geometries are determined by the SVD factors of this same label matrix. We then present extensive experiments on synthetic and real datasets that confirm convergence to the SELI geometry. However, we caution that convergence worsens with increasing imbalances. We theoretically support this finding by showing that unlike the balanced case, when minorities are present, ridge-regularization plays a critical role in tweaking the geometry. This defines new questions and motivates further investigations into the impact of class imbalances on the rates at which first-order methods converge to their asymptotically preferred solutions.

研究动机与目标

  • 为解决当前神经坍缩理论仅适用于类别平衡数据、缺乏对类别不均衡数据下深度神经网络解的统一几何表征的问题。
  • 构建一个理论基础坚实、对类别不均衡保持不变的模型几何描述,将类别平衡时的等角紧框架(ETF)结构推广至类别不均衡场景。
  • 阐明正则化(特别是岭正则化)在存在少数类时对几何结构的影响。
  • 提供一个封闭形式、可解析处理的框架,用于理解在类别不均衡数据下嵌入与分类器的联合几何结构,基于无约束特征模型(UFM)。

提出的方法

  • 采用无约束特征模型(UFM)作为两层代理模型,研究类别不均衡下的神经坍缩现象。
  • 将单纯形编码标签(SEL)矩阵定义为一种结构化标签编码方式,其中每个类别具有唯一的类似独热编码的模式,取值为 $1 - 1/k$ 和 $-1/k$,在 $\mathbb{R}^k$ 中构成一个单纯形。
  • 证明在交叉熵损失下且正则化趋近于零时,学习到的logit矩阵始终精确插值于SEL矩阵,且该结果与类别不均衡无关。
  • 表明嵌入和分类器的几何结构分别完全由SEL矩阵的左、右奇异向量决定。
  • 通过SEL矩阵的SVD分解,推导出类别中心范数与分类器权重夹角的封闭形式表达式。
  • 通过在合成数据集和真实数据集上的实验,表明模型收敛至SELI几何结构,且随着不均衡程度增加,性能退化。

实验结果

研究问题

  • RQ1能否构建一种对类别不均衡保持不变的神经网络解的几何表征,以推广类别平衡数据下的神经坍缩现象?
  • RQ2在使用交叉熵损失训练类别不均衡数据的深度网络中,其logit矩阵是否插值于一种结构化标签矩阵?若是,其形式为何?
  • RQ3在该几何结构下,嵌入与分类器的范数与夹角如何依赖于不均衡比率和类别数量?
  • RQ4与类别平衡情况相比,岭正则化在存在少数类时对几何结构的塑造作用是什么?
  • RQ5SELI几何结构能否用于解释并量化实践中观察到的少数类与多数类分类器之间范数差异?

主要发现

  • 在交叉熵损失下且正则化趋近于零时,学习到的logit矩阵始终精确插值于单纯形编码标签(SEL)矩阵,且该结果与类别不均衡无关。
  • 嵌入与分类器的几何结构完全由SEL矩阵的SVD因子决定,其范数与夹角的表达式可显式地以不均衡比率和类别数量表示。
  • SELI几何结构推广了ETF几何:在类别平衡或仅两分类情况下退化为ETF,但在所有不均衡水平下保持不变。
  • 通过在合成与真实数据集上的广泛实验,验证了模型收敛至SELI几何结构,且随着类别不均衡程度增加,收敛性下降。
  • 岭正则化在类别不均衡条件下对几何结构起关键作用,而类别平衡时其影响较小。
  • 理论分析证实,少数类分类器的范数小于多数类分类器的范数,与先前工作的实证观察结果定量一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。