[论文解读] Prior and Posterior Networks: A Survey on Evidential Deep Learning Methods For Uncertainty Estimation
本综述介绍了证据深度学习(Evidential Deep Learning)作为一种深度神经网络中不确定性估计的方法,通过使用狄利克雷分布建模预测分布,实现在单次前向传播中进行不确定性量化。该综述统一概述了分类与回归任务中的先验网络与后验网络,强调了不确定性校准、分布外(OOD)检测以及实用的实现技术,并提供了实证基准与理论推导。
Popular approaches for quantifying predictive uncertainty in deep neural networks often involve distributions over weights or multiple models, for instance via Markov Chain sampling, ensembling, or Monte Carlo dropout. These techniques usually incur overhead by having to train multiple model instances or do not produce very diverse predictions. This comprehensive and extensive survey aims to familiarize the reader with an alternative class of models based on the concept of Evidential Deep Learning: For unfamiliar data, they aim to admit "what they don't know", and fall back onto a prior belief. Furthermore, they allow uncertainty estimation in a single model and forward pass by parameterizing distributions over distributions. This survey recapitulates existing works, focusing on the implementation in a classification setting, before surveying the application of the same paradigm to regression. We also reflect on the strengths and weaknesses compared to other existing methods and provide the most fundamental derivations using a unified notation to aid future research.
研究动机与目标
- 为深度神经网络中证据深度学习方法的不确定性估计提供全面且易于理解的概述。
- 统一并比较在分类与回归设置中,使用狄利克雷分布对先验或后验进行参数化的现有方法。
- 突出不确定性校准中的挑战,并提出如OOD训练、知识蒸馏和密度估计等解决方案。
- 使用一致的符号推导关键方程,以支持可复现性与未来研究。
- 推动证据深度学习在不确定性量化研究社区之外的更广泛应用。
提出的方法
- 模型使用狄利克雷分布对后验预测分布进行参数化,通过浓度参数 α 实现不确定性估计。
- 预测分布通过单次前向传播计算,避免了蒙特卡洛采样或集成平均。
- 在分类任务中,该方法使用狄利克雷先验,并通过预测中的证据更新它,不确定性由 α₀ = ∑αₖ 推导得出。
- 应用如OOD数据增强、知识蒸馏和熵正则化等技术,以改善不确定性校准。
- 在回归任务中,该框架扩展为使用共轭先验和输出上的证据分布对预测分布进行建模。
- 本综述推导了狄利克雷分布的关键方程,包括期望、方差和多伽马函数,以支持理论一致性。
实验结果
研究问题
- RQ1如何使深度神经网络显式表达不确定性,尤其是对分布外输入?
- RQ2在证据深度学习中,先验网络与后验网络的关键区别是什么,它们如何影响不确定性估计?
- RQ3如OOD数据增强和知识蒸馏等技术如何改善证据模型中的不确定性校准?
- RQ4基于狄利克雷分布的不确定性估计在分类与回归中的理论基础与实际实现是什么?
- RQ5证据模型在性能与校准性方面与传统贝叶斯方法(如MC dropout与集成)相比如何?
主要发现
- 证据深度学习可在单次前向传播中实现不确定性估计,与集成或MCMC方法相比,显著降低了推理成本。
- 使用狄利克雷分布对预测不确定性进行建模的模型,在分布外输入上表现出更好的校准性,通过回归到先验信念实现。
- 在训练中引入OOD样本可减少空虚度(缺乏证据),并提高对分布外样本的检测能力。
- 知识蒸馏与熵正则化有助于稳定训练并改善不确定性估计,尤其在低数据场景下。
- 使用基于图或核的密度估计可提升不确定性建模,通过整合局部结构与邻域信息。
- 对狄利克雷分布的理论推导,包括期望与多伽马函数,对于一致性不确定性量化至关重要,本综述已将其统一呈现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。