[论文解读] Quantifying Aleatoric and Epistemic Uncertainty in Machine Learning: Are Conditional Entropy and Mutual Information Appropriate Measures?
本文批判性地评估了在机器学习中使用条件熵和互信息来量化偶然不确定性与认知不确定性的做法,认为这些信息论度量表现出不一致的行为,无法正确分解总不确定性。作者通过理论分析和实验表明,此类度量通常会产生不切实际的不确定性归属,尤其是在数据有限和分布偏移的情况下,因此呼吁谨慎使用,并倡导采用替代的不确定性形式化方法。
The quantification of aleatoric and epistemic uncertainty in terms of conditional entropy and mutual information, respectively, has recently become quite common in machine learning. While the properties of these measures, which are rooted in information theory, seem appealing at first glance, we identify various incoherencies that call their appropriateness into question. In addition to the measures themselves, we critically discuss the idea of an additive decomposition of total uncertainty into its aleatoric and epistemic constituents. Experiments across different computer vision tasks support our theoretical findings and raise concerns about current practice in uncertainty quantification.
研究动机与目标
- 批判性评估条件熵和互信息作为机器学习中偶然不确定性和认知不确定性度量的适用性。
- 研究总不确定性分解为偶然和认知分量时在理论和经验上存在的不一致。
- 评估不同概率学习方法(例如,拉普拉斯近似、深度集成)在不同数据和模型条件下对不确定性估计的影响。
- 强调经典概率表示在捕捉认知不确定性方面的局限性,尤其是在低数据场景下。
- 倡导重新审视当前的不确定性量化实践,并探索超越标准概率论的替代形式化方法。
提出的方法
- 在预测不确定性分解背景下,对信息论度量(香农熵、条件熵、互信息)进行理论分析。
- 将不确定性分解形式化为 TU = AU + EU,其中 AU 通过条件熵度量,EU 通过互信息度量。
- 在计算机视觉任务(例如,CIFAR-10、分布外检测)上,使用多种模型(拉普拉斯近似、深度集成、贝叶斯神经网络)进行实证评估。
- 消融研究以隔离模型容量和训练数据规模对不确定性估计的影响。
- 使用合成数据实验,评估在受控插值和分布偏移下的不确定性行为。
- 比较不同概率学习器之间的不确定性行为,重点关注校准性和预测性能。
实验结果
研究问题
- RQ1条件熵和互信息是否在机器学习中为偶然不确定性和认知不确定性提供了连贯且有意义的度量?
- RQ2将总不确定性分解为偶然和认知分量的加法形式在理论上和经验上是否合理?
- RQ3不同概率学习方法(例如,拉普拉斯近似、深度集成)如何影响不确定性在偶然和认知分量之间的归属?
- RQ4当存在认知不确定性时,有限样本估计对偶然不确定性解释有何影响?
- RQ5经典概率分布是否能充分表示认知不确定性,尤其是在完全无知的情况下?
主要发现
- 基于条件熵的偶然不确定性度量表现出不切实际的行为,特别是在真实数据生成过程不完全已知时,这是由于其对主观认知不确定性的依赖。
- 用作认知不确定性度量的互信息更像是一种差异度量而非真正的无知指标,导致误导性解释。
- 总不确定性的加法分解在理论上不一致,因为该分解依赖于有限样本估计和模型假设,而非客观真实值。
- 在低数据场景下,各种方法均持续低估认知不确定性,表明不确定性估计中存在系统性过度自信。
- 深度集成在分布偏移下产生的总不确定性高于拉普拉斯近似,但在分解为偶然和认知分量时仍表现出不切实际的归属。
- 概率学习器的设计显著影响不确定性估计,即使预测准确性相似,表明不确定性行为对模型架构和训练过程高度敏感。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。