Skip to main content
QUICK REVIEW

[论文解读] Optimizing Neural Networks with Gradient Lexicase Selection

Li Ding, Lee Spector|arXiv (Cornell University)|Dec 19, 2023
Evolutionary Algorithms and Applications被引用 6
一句话总结

本文提出梯度字典序选择(Gradient Lexicase Selection),一种融合字典序选择与随机梯度下降的进化优化框架,以提升深度神经网络的泛化能力。该方法基于单个训练样本的误差而非聚合损失来选择模型更新,从而增强表示多样性,并在多个图像分类基准和网络架构上实现一致的准确率提升。

ABSTRACT

One potential drawback of using aggregated performance measurement in machine learning is that models may learn to accept higher errors on some training cases as compromises for lower errors on others, with the lower errors actually being instances of overfitting. This can lead to both stagnation at local optima and poor generalization. Lexicase selection is an uncompromising method developed in evolutionary computation, which selects models on the basis of sequences of individual training case errors instead of using aggregated metrics such as loss and accuracy. In this paper, we investigate how lexicase selection, in its general form, can be integrated into the context of deep learning to enhance generalization. We propose Gradient Lexicase Selection, an optimization framework that combines gradient descent and lexicase selection in an evolutionary fashion. Our experimental results demonstrate that the proposed method improves the generalization performance of various widely-used deep neural network architectures across three image classification benchmarks. Additionally, qualitative analysis suggests that our method assists networks in learning more diverse representations. Our source code is available on GitHub: https://github.com/ld-ing/gradient-lexicase.

研究动机与目标

  • 为解决深度学习中聚合损失函数的局限性,其可能导致个别训练样本性能下降并阻碍泛化。
  • 探究原本用于进化计算的字典序选择是否能提升深度神经网络的表示多样性与泛化能力。
  • 开发一种混合优化框架,结合梯度下降的效率与字典序选择的无妥协选择策略。
  • 在图像分类的多样化架构与基准数据集上,评估该方法的鲁棒性与有效性。

提出的方法

  • 该方法用基于个体训练样本误差序列而非聚合损失的字典序选择过程,替代标准的基于梯度的权重更新。
  • 在每个训练步骤中,维护一个模型副本的种群,每个副本在随机小批量数据上通过随机梯度下降进行更新。
  • 每次更新后,使用字典序选择对模型进行排序:候选模型按随机排列的训练样本顺序逐步淘汰,从而保留多样性。
  • 最终从种群中选择在所有样本上均实现低误差且无妥协的模型,以促进鲁棒且可泛化的表示。
  • 该框架支持多个模型实例的并行训练,可在现代硬件上实现高效计算。
  • 通过调整种群大小与动量等超参数,平衡搜索过程中的探索与利用。

实验结果

研究问题

  • RQ1传统上用于进化计算的字典序选择,能否提升使用梯度下降训练的深度神经网络的泛化能力?
  • RQ2避免使用聚合损失函数是否能减少对特定训练样本的过拟合,并提升深度神经网络的表示多样性?
  • RQ3将字典序选择整合到深度学习中,对标准图像分类基准上多种深度学习架构的性能有何影响?
  • RQ4在所提出的框架中,种群大小、动量与泛化性能之间的权衡关系如何?
  • RQ5与标准SGD相比,该方法在多大程度上增强了特征表示的多样性?

主要发现

  • 梯度字典序选择在CIFAR-10、CIFAR-100和SVHN基准上,对六种广泛使用的深度神经网络架构(VGG、ResNet、DenseNet、MobileNetV2、SENet和EfficientNet)均提升了测试准确率。
  • 该方法在不同架构与数据集上均持续优于标准SGD及基线选择策略(随机选择与锦标赛选择),展现出良好的鲁棒性。
  • 消融研究显示,性能提升主要源于字典序选择机制本身,而非仅依赖于种群训练结构。
  • 定性分析表明,采用梯度字典序选择训练的模型在卷积层中学习到更平坦、更具多样性的激活分布,这与更好的泛化能力相关。
  • 即使种群规模仅为标准SGD的四倍,该方法仍能实现更优性能,表明其具有计算效率。
  • 表示多样性分析证实,该方法减少了对特定特征的过度依赖,促进了更广泛、更具泛化能力的特征学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。