[论文解读] Going Beyond One-Hot Encoding in Classification: Can Human Uncertainty Improve Model Performance?
本文提出通过使用来自多位专家投票的分布标签(distributional labels)替代传统的独热编码(one-hot encoding),将人类标注的不确定性显式地引入深度学习分类任务。通过采用带有KL散度损失的标签分布学习(Label Distribution Learning)方法,模型在泛化能力(测试交叉熵降低10%)和校准性(预期校准误差几乎减半)方面均实现显著提升,表明对标签不确定性的显式建模可同时增强遥感图像分类任务中的模型性能与可靠性。
Technological and computational advances continuously drive forward the broad field of deep learning. In recent years, the derivation of quantities describing theuncertainty in the prediction - which naturally accompanies the modeling process - has sparked general interest in the deep learning community. Often neglected in the machine learning setting is the human uncertainty that influences numerous labeling processes. As the core of this work, label uncertainty is explicitly embedded into the training process via distributional labels. We demonstrate the effectiveness of our approach on image classification with a remote sensing data set that contains multiple label votes by domain experts for each image: The incorporation of label uncertainty helps the model to generalize better to unseen data and increases model performance. Similar to existing calibration methods, the distributional labels lead to better-calibrated probabilities, which in turn yield more certain and trustworthy predictions.
研究动机与目标
- 探究在标注中引入人类不确定性是否能提升深度学习模型的性能与校准性。
- 解决在专家标注数据集中标签模糊性与不确定性这一被研究不足的问题,尤其在遥感领域。
- 评估基于多位专家投票生成的分布标签是否在分类任务中优于传统的独热编码。
- 证明建模标签不确定性可带来更优校准性与更可靠的预测概率。
提出的方法
- 作者使用So2Sat LCZ42数据集,该数据集为每张卫星图像提供10位专家的标注,用于构建反映人类不确定性的经验标签分布。
- 将这些标签分布作为标签分布学习框架中的目标,替代标准的独热编码。
- 采用KL散度作为损失函数,训练神经网络分类器,以最小化预测标签分布与真实标签分布之间的差异。
- 该方法保持模型架构与超参数不变,从而隔离标签不确定性对性能与校准性的影响。
- 通过预期校准误差(Expected Calibration Error, ECE)评估模型校准性,通过在未见数据上的交叉熵损失衡量泛化能力。
- 将该方法与未建模不确定性的标准基线模型,以及温度缩放(temperature scaling)和标签平滑(label smoothing)等现成校准技术进行对比。
实验结果
研究问题
- RQ1在图像分类任务中,对标签中的人类不确定性进行建模是否能提升深度学习模型的泛化性能?
- RQ2将基于专家投票生成的分布标签引入模型,是否能带来更优校准的预测概率?
- RQ3在相同遥感数据集上,使用分布标签训练的模型与使用独热编码训练的模型相比,性能如何?
- RQ4在无需额外超参数调优的情况下,标签不确定性建模是否能降低预期校准误差(ECE)?
主要发现
- 与独热编码基线相比,使用分布标签训练的模型在测试交叉熵损失上平均降低10%,表明泛化能力得到提升。
- 当显式建模人类不确定性时,预期校准误差(ECE)几乎减半,表明预测概率的校准性显著改善。
- 在无需额外超参数调优的情况下,该不确定性引导方法在校准性提升方面优于标准校准技术(如标签平滑与温度缩放)。
- 该方法表明,由专家投票生成的标签分布能有效捕捉人类固有的不确定性,并提升模型的可靠性。
- 即使在固定模型架构下,引入标签不确定性仍可在预测准确率与置信度校准性方面带来可测量的提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。