Skip to main content
QUICK REVIEW

[论文解读] Measuring Classification Decision Certainty and Doubt

Alexander Berenbeim, Iain J. Cruickshank|arXiv (Cornell University)|Mar 25, 2023
Machine Learning and Data Classification被引用 5
一句话总结

本文引入了确定性与怀疑分数,作为量化多分类分类模型不确定性的一系列直观且数学基础坚实的度量指标。通过使用概率差值及其倒数,提出了成对与原始的确定性与怀疑度量形式,结合射影几何的几何解释以及惩罚退化概率分配的代价函数,实现了更优的不确定性感知模型评估与训练。

ABSTRACT

Quantitative characterizations and estimations of uncertainty are of fundamental importance in optimization and decision-making processes. Herein, we propose intuitive scores, which we call certainty and doubt, that can be used in both a Bayesian and frequentist framework to assess and compare the quality and uncertainty of predictions in (multi-)classification decision machine learning problems.

研究动机与目标

  • 开发多分类分类模型中决策确定性与怀疑度的可解释、可量化的度量方法。
  • 在预测尾部概率显著影响结果的安全关键人工智能应用中,实现不确定性感知的决策制定。
  • 在贝叶斯与频率学派框架下,将确定性与怀疑度正式化为互为倒数、具有几何可解释性的评分。
  • 提出可最小化怀疑度并惩罚模糊预测的代价函数,以增强模型鲁棒性。
  • 提供一种基于不确定性特征比较神经网络架构的框架。

提出的方法

  • 将成对确定性定义为最高概率与其他各类概率的差值:$\chi_i = \pi_j(\mathbf{p}) - \pi_i(\mathbf{p})$,其中 $i \neq j$。
  • 将成对怀疑度定义为该差值的倒数:$\delta_i = 1 / (\pi_j(\mathbf{p}) - \pi_i(\mathbf{p}))$,其中 $i \neq j$,且当 $i = j$ 时 $\delta_i = 0$。
  • 通过未归一化的 logits $\mathbf{y}$ 引入原始确定性与怀疑度:$\xi_i = \pi_j(\mathbf{y}) - \pi_i(\mathbf{y})$ 与 $\rho_i = 1 / (\pi_j(\mathbf{y}) - \pi_i(\mathbf{y}))$,其中 $i \neq j$。
  • 使用斜对称矩阵 $\mathbf{C}^o(\mathbf{p}) = \mathbf{p}\mathbf{1}^T - \mathbf{1}\mathbf{p}^T$ 与 $\mathbf{C}(\mathbf{p}) = \mathbf{I} + \mathbf{C}^o(\mathbf{p})$ 来表示所有类别之间的成对确定性。
  • 提出怀疑度为 $\mathbf{D}(\mathbf{p}) = \text{Inv}(\mathbf{C}(\mathbf{p})) - \mathbf{I}$,其中 Inv 表示逐元素求逆,以避免对称情况下产生误导的单位矩阵结果。
  • 利用球极投影与射影几何在 $\mathbb{R}\mathbb{P}^1$ 上建模怀疑度,代价函数基于 $\arcsin\left(\frac{1 - \prod_{i \neq j} \chi_i^2}{1 + \prod_{i \neq j} \chi_i^2}\right)$,以惩罚高怀疑度情况。

实验结果

研究问题

  • RQ1如何使用可解释、可扩展的度量方法,正式量化多分类分类模型中的决策确定性与怀疑度?
  • RQ2在预测概率几乎相等时,哪种几何框架最能捕捉不确定性的直观概念?
  • RQ3如何利用确定性与怀疑度评分来改进安全关键应用中的模型评估与训练?
  • RQ4哪些代价函数能有效最小化怀疑度,同时保持平滑且可微,以支持优化?
  • RQ5在不确定性行为方面,不同神经网络架构的确定性与怀疑度评分有何差异?

主要发现

  • 所提出的确定性与怀疑度评分互为倒数,当最高两个预测概率相等时,确定性为零,怀疑度为无穷大,反映了最大不确定性。
  • 原始怀疑度评分 $\rho_i$ 定义为最高 logit 与其他 logit 差值的倒数,确保在不同模型间具有有意义的可比性。
  • 基于矩阵的确定性表示 $\mathbf{C}(\mathbf{p})$ 是可逆的,其逐元素求逆减去单位矩阵,相比 $\mathbf{C}^{-1}$ 能提供更准确的怀疑度度量。
  • 利用射影几何时,可将怀疑度表示为 $\mathbb{R}\mathbb{P}^1$ 上的点,其中 $[0:1]$ 对应于概率相等时的无穷怀疑度。
  • 所提出的代价函数 $\arcsin\left(\frac{1 - \prod \chi_i^2}{1 + \prod \chi_i^2}\right)$ 能够惩罚退化概率分配(即 $\prod (p_1 - p_i) = 0$ 的情况),表明存在高度模糊性。
  • 该框架支持基于概率与基于 logits 的两种表述形式,提升了实现灵活性,并与标准深度学习流水线兼容。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。