[论文解读] MMA Regularization: Decorrelating Weights of Neural Networks by Maximizing the Minimal Angles
本文提出MMA正则化,一种新颖的方法,通过最大化每层中归一化权重向量之间的最小成对夹角来提升神经网络的泛化能力,其灵感来源于塔姆斯问题。通过引入一种稳定且可微的正则化项,以可忽略的计算成本促进角度多样性,MMA在CIFAR100和TinyImageNet上实现了最先进性能提升,并在人脸识别任务中改善了特征学习。
The strong correlation between neurons or filters can significantly weaken the generalization ability of neural networks. Inspired by the well-known Tammes problem, we propose a novel diversity regularization method to address this issue, which makes the normalized weight vectors of neurons or filters distributed on a hypersphere as uniformly as possible, through maximizing the minimal pairwise angles (MMA). This method can easily exert its effect by plugging the MMA regularization term into the loss function with negligible computational overhead. The MMA regularization is simple, efficient, and effective. Therefore, it can be used as a basic regularization method in neural network training. Extensive experiments demonstrate that MMA regularization is able to enhance the generalization ability of various modern models and achieves considerable performance improvements on CIFAR100 and TinyImageNet datasets. In addition, experiments on face verification show that MMA regularization is also effective for feature learning. Code is available at: https://github.com/wznpub/MMA_Regularization.
研究动机与目标
- 解决过参数化神经网络中的权重相关性问题,该问题会降低泛化性能。
- 开发一种简单、高效且有效的正则化方法,以促进权重向量之间的角度多样性。
- 克服现有方法的局限性,如正交正则化(会导致聚类)和MHE(计算成本高)。
- 为任意网络架构和层维度提供可扩展的解决方案。
提出的方法
- 将问题建模为最大化归一化权重向量之间的最小成对夹角,灵感来源于塔姆斯问题。
- 设计一种可微的正则化项,以促进权重向量在超球面上的均匀分布。
- 使用数值优化方法,近似求解任意神经元数量和维度下的塔姆斯问题。
- 以极低的计算开销将MMA正则化项集成到损失函数中。
- 确保所有层的梯度稳定与一致,以实现可靠的优化。
- 将该方法应用于隐藏层和输出层,以解耦滤波器并提升类间可分性。
实验结果
研究问题
- RQ1最大化权重向量之间的最小成对夹角是否能提升深度神经网络的泛化能力?
- RQ2与正交正则化和MHE正则化相比,MMA正则化在性能和效率方面表现如何?
- RQ3MMA正则化是否能有效降低滤波器相关性,并在卷积层和全连接层中增强特征多样性?
- RQ4MMA能否在图像分类和人脸识别任务中均有效应用?
- RQ5MMA正则化在不同网络架构中的计算成本和可扩展性如何?
主要发现
- 在CIFAR100上训练的VGG19-BN模型中,MMA正则化使滤波器余弦相似度高于0.2的数量为0,显著优于基线(495)、正交正则化(120)和MHE(51)。
- 在使用MMA时,所有层的最小成对夹角均保持最大,表明其具有更优的角度多样性。
- 在CIFAR100上,MMA正则化相比基线将Top-1准确率提升最高达1.8%,且在多个模型中均表现出一致增益。
- 在TinyImageNet上,MMA相比基线实现了1.5%的准确率提升,证明其在大规模数据集上的有效性。
- 在人脸识别任务中,MMA在LFW、CFP-FP和AgeDB-30上均提升了性能,证实其在深度特征学习中的有效性。
- 该方法计算开销可忽略,易于即插即用,适合作为标准正则化技术。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。