Skip to main content
QUICK REVIEW

[论文解读] Evaluating the Impact of Loss Function Variation in Deep Learning for Classification

Simon Dräger, Jannik Dunkelau|arXiv (Cornell University)|Oct 28, 2022
Machine Learning and Data Classification被引用 4
一句话总结

本文通过实证方法评估了不同损失函数——MSE、MAE、CCE 和 KLD——在多个数据集上的深度学习分类性能影响。结果表明,在六组数据集中的四组上,Kullback-Leibler 散度(KLD)的表现优于广泛使用的交叉熵(CCE)损失,挑战了将 CCE 视为默认选择的教条化做法,并主张将损失函数视为可调节的超参数,而非固定不变的选择。

ABSTRACT

The loss function is arguably among the most important hyperparameters for a neural network. Many loss functions have been designed to date, making a correct choice nontrivial. However, elaborate justifications regarding the choice of the loss function are not made in related work. This is, as we see it, an indication of a dogmatic mindset in the deep learning community which lacks empirical foundation. In this work, we consider deep neural networks in a supervised classification setting and analyze the impact the choice of loss function has onto the training result. While certain loss functions perform suboptimally, our work empirically shows that under-represented losses such as the KL Divergence can outperform the State-of-the-Art choices significantly, highlighting the need to include the loss function as a tuned hyperparameter rather than a fixed choice.

研究动机与目标

  • 挑战深度学习分类中将交叉熵(CCE)作为默认损失函数的普遍且未经审视的采纳做法。
  • 通过实证方法评估不同损失函数对模型性能、收敛性和稳定性的影响,涵盖多种数据集。
  • 证明如 KLD 这类被低估的损失函数在多分类设置中可显著优于当前最先进的选择。
  • 倡导将损失函数视为可优化的超参数,而非固定不变的公理。
  • 鼓励进一步研究定制化和信息论相关的损失函数,如 f-散度。

提出的方法

  • 本研究评估了四种标准损失函数:均方误差(MSE)、平均绝对误差(MAE)、分类交叉熵(CCE)和 Kullback-Leibler 散度(KLD)。
  • 每种损失函数均应用于相同的深度神经网络架构,并在六个基准数据集上进行测试:Mushroom、Phishing、MNIST、Fashion-MNIST、CIFAR-10 和 CharFontIm。
  • 所有模型均使用相同的优化器(Adam)和超参数训练 100 个周期,性能通过测试准确率、均值标准误(SEM)、F1 分数(ϕ)和 AUC 进行衡量。
  • KLD 在数学上被分解为 CCE 减去标签熵,突显其作为信息论解释的含义:即编码数据所需的额外比特数。
  • 实验在多个随机种子下重复进行,以计算平均性能和标准误,确保统计可靠性。
  • 通过准确率和鲁棒性指标(ϕ 和 AUC)对不同损失函数的性能进行比较,结果以表格形式呈现,便于直接对比。

实验结果

研究问题

  • RQ1损失函数的选择是否显著影响深度神经网络的最终分类准确率?
  • RQ2在标准分类任务中,如 KLD 这类不常见的损失函数是否能优于广泛采用的交叉熵(CCE)损失?
  • RQ3不同损失函数如何影响模型的稳定性和收敛性,以标准误和鲁棒性指标衡量?
  • RQ4为何尽管在回归任务中对异常值具有鲁棒性,MAE 在复杂图像数据集上表现不佳?
  • RQ5在深度学习流程中,损失函数在多大程度上应被视为可调节的超参数,而非固定的默认值?

主要发现

  • 在 MNIST 数据集上,MAE 达到 99.30% ± 0.01% 的测试准确率,优于 CCE(98.99% ± 0.03%)和 KLD(98.84% ± 0.04%),表明其可能在学习条件中位数方面有效。
  • 在 Mushroom 数据集上,KLD 达到 100.00% ± 0.00% 的准确率,显著优于 CCE(99.67% ± 0.10%)和 MSE(99.69% ± 0.26%),且 F1 分数和 AUC 均为完美值。
  • 在 Fashion-MNIST 上,KLD 达到 90.47% ± 0.11% 的准确率,优于 CCE(88.60% ± 0.11%)和 MSE(87.96% ± 0.04%),且 F1 分数最高(0.89),AUC 最高(0.99)。
  • 在 CIFAR-10 上,CCE 达到 78.13% ± 0.28% 的准确率,为所有损失中最高,而 KLD 仅达到 70.05% ± 0.30%,表明 CCE 在复杂彩色图像分类任务中仍占优势。
  • 在 CharFontIm 上,KLD 达到 76.62% ± 0.02% 的准确率和 0.99 的 AUC,优于 CCE(69.21% ± 0.97% 的准确率)和 MAE(3.37% ± 1.52%),表明其在非标准图像数据上表现强劲。
  • KLD 在六组数据集中的四组上持续取得最佳或接近最佳的表现,且 F1 分数和 AUC 值均较高,表明其在多分类设置中具有强大的泛化能力和鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。