[论文解读] Taming the Cross Entropy Loss
本文提出了一种鲁棒的交叉熵损失变体——驯服交叉熵(Tamed Cross Entropy, TCE)损失,该损失在保持原始交叉熵(CE)损失快速收敛特性的同时,显著提升了对标签噪声的鲁棒性。通过对接近标准CE损失梯度的幂归一化,TCE降低了低置信度预测的梯度更新,从而在不改变训练超参数的前提下有效抑制噪声。在ResNet-20与含噪声图像数据集的实验中,TCE在80%标签噪声条件下相比CE最高实现了9.80%的Top-1准确率提升。
We present the Tamed Cross Entropy (TCE) loss function, a robust derivative of the standard Cross Entropy (CE) loss used in deep learning for classification tasks. However, unlike other robust losses, the TCE loss is designed to exhibit the same training properties than the CE loss in noiseless scenarios. Therefore, the TCE loss requires no modification on the training regime compared to the CE loss and, in consequence, can be applied in all applications where the CE loss is currently used. We evaluate the TCE loss using the ResNet architecture on four image datasets that we artificially contaminated with various levels of label noise. The TCE loss outperforms the CE loss in every tested scenario.
研究动机与目标
- 解决标准交叉熵(CE)损失在深度学习分类任务中对标签噪声的脆弱性问题。
- 开发一种损失函数,既能保持CE的快速收敛与训练行为,又能提升对噪声或误标数据的鲁棒性。
- 创建一种可直接替换CE的损失函数,无需修改训练方案或超参数。
- 在人工标签污染的真实场景中,评估鲁棒性与收敛速度之间的权衡。
提出的方法
- 通过在标准CE损失梯度上应用幂归一化,推导出TCE损失,其参数化由α控制。
- 归一化确保当模型置信度高时(qi → 1),TCE梯度与CE梯度一致,从而保持收敛速度。
- 当模型置信度低时(qi → 0),TCE梯度趋近于零,从而减少来自误标或异常样本的反馈。
- 该方法设计为与现有训练流程兼容,确保在干净数据下与CE保持相同的优化动态。
- 在MNIST、CIFAR10+、CIFAR100+和VSHN数据集上,使用ResNet-20对TCE损失进行评估,标签经人工污染。
- 在α值范围(0.5至2.0)内测试损失函数,以评估其敏感性及最优权衡。
实验结果
研究问题
- RQ1经过修改的交叉熵损失是否能在保持标准CE快速收敛的同时,对标签噪声更具鲁棒性?
- RQ2在随机标签噪声不断增加的情况下,TCE损失相较于CE、MSE和MAE的表现如何?
- RQ3在TCE损失中,正则化参数α的最优值是多少,以实现鲁棒性与收敛速度的平衡?
- RQ4当TCE损失作为CE的直接替换而无需超参数调优时,是否能保持训练稳定性和性能?
主要发现
- 在CIFAR100+数据集上,80%随机标签噪声条件下,α = 1.5的TCE损失达到87.30%的Top-1准确率,比CE高出4.94个百分点。
- 在80%标签噪声下,TCE在CIFAR100+上相比CE提升了9.80%的Top-1准确率,在CIFAR10+上提升了9.36%,在VSHN上提升了4.94%。
- 当α = 1.0时,TCE的收敛速度几乎与CE相同,同时在所有噪声水平下均实现了比CE更高的准确率。
- 当α > 1.5时,收敛速度虽有所下降,但仍显著快于MSE,表明在α = 1.5时实现了有利的权衡。
- 即使在0%标签噪声条件下,CE损失也表现出随时间推移的性能退化,表明其存在固有不稳定性;而TCE与MSE则更具鲁棒性。
- TCE损失在所有数据集和噪声水平下均保持高性能,且在0.5 ≤ α ≤ 2.0范围内对α的敏感性极低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。