Skip to main content
QUICK REVIEW

[论文解读] Being Bayesian about Categorical Probability

Taejong Joo, Uijung Chung|ArXiv.org|Feb 19, 2020
Anomaly Detection Techniques and Applications参考文献 62被引用 10
一句话总结

本文提出了一种贝叶斯化的软最大函数替代方法,通过使用狄利克雷先验对类别概率进行建模,将类别概率视为随机变量,从而实现更优的不确定性估计和模型校准。该方法用信念匹配框架替代交叉熵损失,利用贝叶斯法则更新信念,实现了在计算开销极低的前提下,泛化能力和校准性能的持续提升。

ABSTRACT

Neural networks utilize the softmax as a building block in classification tasks, which contains an overconfidence problem and lacks an uncertainty representation ability. As a Bayesian alternative to the softmax, we consider a random variable of a categorical probability over class labels. In this framework, the prior distribution explicitly models the presumed noise inherent in the observed label, which provides consistent gains in generalization performance in multiple challenging tasks. The proposed method inherits advantages of Bayesian approaches that achieve better uncertainty estimation and model calibration. Our method can be implemented as a plug-and-play loss function with negligible computational overhead compared to the softmax with the cross-entropy loss function.

研究动机与目标

  • 解决标准软最大函数在深度神经网络中过度自信及校准性能差的问题。
  • 在不进行重大网络结构修改的前提下,提升深度学习模型的泛化性能。
  • 通过将类别概率视为随机变量,实现在分类任务中高效的贝叶斯推理。
  • 提供一种即插即用的损失函数,以极低的计算成本增强不确定性表征能力。

提出的方法

  • 将类别概率分布建模为具有狄利克雷先验的随机变量,以编码标签噪声和不确定性。
  • 应用贝叶斯法则,利用观测标签更新先验信念,形成类别概率的后验分布。
  • 用信念匹配损失替代标准软最大函数的交叉熵损失,通过最小化预测分布与后验分布之间的KL散度实现优化。
  • 采用变分推理近似难以计算的后验分布,从而支持端到端训练。
  • 将该方法实现为即插即用的损失函数,与现有深度学习框架和模型完全兼容。
  • 采用狄利克雷共轭先验,实现解析更新,高效计算后验分布。

实验结果

研究问题

  • RQ1将类别概率建模为随机变量是否能提升深度神经网络中的模型校准性能与不确定性估计?
  • RQ2所提出的信念匹配框架在泛化能力和鲁棒性方面与标准软最大函数交叉熵损失相比表现如何?
  • RQ3该贝叶斯方法能否在仅做最小网络结构修改和计算开销的前提下,无缝集成到现有深度学习模型中?
  • RQ4该方法是否通过捕捉预测中更丰富的概率结构,提升了半监督学习中的性能?

主要发现

  • 在使用 VAT 的 CIFAR-10 数据集上,信念匹配(BM)方法将测试误差率降低至 12.40% ± 0.23,优于标准软最大函数的 13.33% ± 0.37。
  • 在 CIFAR-10 数据集上使用 Π-model 时,BM 方法取得 16.01% ± 0.36 的测试误差率,优于标准软最大函数的 16.52% ± 0.21。
  • 该方法在大型模型(如 ImageNet 上的 ResNeXt-101)上也提升了泛化性能,表明其在各类基准测试中均具有一致的性能增益。
  • 信念匹配框架捕捉到的 probabilistic 结构比基于矩的约束损失(如预测的(协)方差)更丰富。
  • 该方法在无需修改网络结构且计算开销极低的前提下,实现了更优的不确定性估计与模型校准。
  • 该方法在半监督学习中表现出有效性,通过分布级别的匹配实现了更复杂的的一致性度量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。