[论文解读] Learning Diverse and Discriminative Representations via the Principle of Maximal Coding Rate Reduction
本论文提出 Maximal Coding Rate Reduction (MCR2),一种信息论目标,通过最大化整体数据与每类子集之间的编码率差来学习跨有监督、自监督、无监督设置的多样且判别性强的表示,同时对标签噪声具有鲁棒性并在聚类性能方面表现出色。
To learn intrinsic low-dimensional structures from high-dimensional data that most discriminate between classes, we propose the principle of Maximal Coding Rate Reduction ($ ext{MCR}^2$), an information-theoretic measure that maximizes the coding rate difference between the whole dataset and the sum of each individual class. We clarify its relationships with most existing frameworks such as cross-entropy, information bottleneck, information gain, contractive and contrastive learning, and provide theoretical guarantees for learning diverse and discriminative features. The coding rate can be accurately computed from finite samples of degenerate subspace-like distributions and can learn intrinsic representations in supervised, self-supervised, and unsupervised settings in a unified manner. Empirically, the representations learned using this principle alone are significantly more robust to label corruptions in classification than those using cross-entropy, and can lead to state-of-the-art results in clustering mixed data from self-learned invariant features.
研究动机与目标
- 在高维数据中,激励学习区分类别的固有低维结构。
- 定义并优化一个基于编码率降低的原则性度量(MCR2),以在类间多样性和类内紧凑性之间进行权衡。
- 为学习多样且具判别性的特征提供理论保证。
- 在一个统一框架内证明 MCR2 能跨越有监督、自监督和无监督设置工作。
- 展示对标签污染具有鲁棒性,并在真实数据上实现具竞争力的聚类性能。
提出的方法
- 定义编码率 R(Z, ε) 和按样本分区 Π 的类内编码率 R^c(Z, ε|Π)。
- 将 ΔR(Z, Π, ε) = R(Z, ε) – R^c(Z, ε|Π) 建模并在 Z_j (Σ) 上施加归一化约束以确保尺度可比。
- 理论化在适当条件下,最优的 MCR2 表征将产生类间正交以及类内子空间维度的最大化。
- 将 MCR2 与信息增益和对比学习联系起来,并将其与基于核范数的损失(OLE)进行对比。
- 通过小批量随机梯度下降在有监督(来自标签的固定 Π)和自监督(通过样本标记的增强)设置下对损失进行优化。
- 在有监督学习中使用最近子空间分类器,在自监督/无监督设置中使用聚类指标来评估表示。
实验结果
研究问题
- RQ1一个与标签无关的、基于速率的度量能否定量化适用于有监督、自监督和无监督学习的表示紧凑性?
- RQ2最大化编码率降低是否能在不同学习范式下产生具判别性、多样性且鲁棒的表示?
- RQ3在鲁棒性到标签噪声和聚类性能方面,MCR2 与交叉熵、信息瓶颈和对比学习相比如何?
- RQ4在子空间(低维)范围内,MCR2 表示的理论特性是什么?
- RQ5在适当条件下,MCR2 是否能够自动促进正交且维度最大的多类子空间结构?
主要发现
- 在有监督训练过程中,MCR2 学得的表示整体数据编码率 R 增加,而按类的编码率 R^c 减少,表明全局结构扩张和类特定结构压缩。
- 与交叉熵相比,MCR2 学得的表示显示出更高的多样性(每个类内的子空间维度更大),表明特征更鲁棒且多方面。
- MCR2 训练对标签损坏具有鲁棒性,当标签损坏增加时,相较于交叉熵仍保持更高的准确率。
- 在自监督/基于增强的设置中,MCR2(具有受控的动态)实现了有竞争力的聚类性能,包括在 CIFAR10 上对不变特征的强劲结果。
- 理论分析表明,在适当条件下,最优的 Z* 具有正交的类别子空间和最大维度,促进多样且具判别性的表示。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。