[论文解读] Pitfalls of Epistemic Uncertainty Quantification through Loss Minimisation
本文批判性地审视了利用损失最小化训练二阶学习器以预测概率分布之分布,从而量化认识论不确定性的方法。研究证明,标准损失函数无法激励模型忠实呈现认识论不确定性,无论数据量大小,均常导致过度自信或不自信,从而削弱机器学习模型中不确定性量化结果的可靠性。
Uncertainty quantification has received increasing attention in machine learning in the recent past. In particular, a distinction between aleatoric and epistemic uncertainty has been found useful in this regard. The latter refers to the learner's (lack of) knowledge and appears to be especially difficult to measure and quantify. In this paper, we analyse a recent proposal based on the idea of a second-order learner, which yields predictions in the form of distributions over probability distributions. While standard (first-order) learners can be trained to predict accurate probabilities, namely by minimising suitable loss functions on sample data, we show that loss minimisation does not work for second-order predictors: The loss functions proposed for inducing such predictors do not incentivise the learner to represent its epistemic uncertainty in a faithful way.
研究动机与目标
- 探究经验损失最小化是否能可靠地训练出能够表征认识论不确定性的二阶预测器。
- 分析现有损失函数在认识论不确定性量化背景下对二阶学习所施加的激励机制。
- 证明即使在数据量不断增加的情况下,当前方法也无法产生忠实的认识论不确定性表征。
- 质疑依赖于二阶模型损失训练的广泛使用之不确定性量化方法的有效性。
- 强调由于缺乏不确定性的真实参考标准,认识论不确定性量化存在根本性困难。
提出的方法
- 作者分析了一种二阶学习框架,其中模型预测一个概率分布的分布(第二层)以表征认识论不确定性。
- 他们研究了文献中提出的各种损失函数在训练此类二阶预测器时的期望损失。
- 形式化分析表明,最小化这些损失函数与最小化真实认识论不确定性并不一致,导致置信度估计失真。
- 通过不同样本大小和正则化参数(λ)的合成数据模拟,评估二阶模型的行为。
- 研究使用第二层分布的微分熵来量化不确定性,结果同时报告了熵值和模型的置信度估计(θ̂)。
- 分析还包含多分类设置,以验证结论在二分类之外的普适性。
实验结果
研究问题
- RQ1现有用于二阶学习的损失函数是否激励模型忠实表征认识论不确定性?
- RQ2在损失最小化下,随着训练样本量增加,认识论不确定性是否减小?
- RQ3正则化参数λ如何影响模型的置信度和不确定性表征?
- RQ4在基于损失的训练下,第二层不确定性表征是否独立于底层数据生成过程?
- RQ5在缺乏不确定性真实参考标准的情况下,损失最小化能否可靠地生成校准的认识论不确定性估计?
主要发现
- 当λ值较小时,二阶模型(ELM)坍缩为熵为零的狄拉克-δ分布,表明存在不合理的过度自信。
- 当λ值较大时,即使样本量很大,模型仍远离狄拉克-δ分布,表明存在持续的过度自信或不自信。
- 尽管第一层不确定性有显著变化,第二层不确定性在不同λ值和样本量下几乎保持不变,表明λ的作用是任意而非信息性的。
- 随着样本量增加,模型的置信度估计(θ̂)并未收敛至真实值(0.5),表明其未能学习到正确的真实认识论不确定性。
- 所有λ和N值下的报告第二层不确定性几乎完全相同,表明损失函数未能有意义地反映真实不确定性。
- 结果证实,损失最小化无法为忠实的认识论不确定性表征提供恰当激励,从而削弱了此类方法的可靠性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。