Skip to main content
QUICK REVIEW

[论文解读] Regression Prior Networks

Andrey Malinin, Sergey Chervontsev|arXiv (Cornell University)|Jun 20, 2020
Anomaly Detection Techniques and Applications参考文献 42被引用 18
一句话总结

该论文提出回归先验网络(RPNs),一种使用正态-Wishart分布对回归任务中的预测不确定性进行建模的新方法。通过将先验网络和集成分布蒸馏(EnD²)扩展至回归任务,RPNs在单一模型中实现了集成级别的性能与不确定性校准,优于UCI数据集和单目深度估计基准上的最先进单模型及蒸馏方法。

ABSTRACT

Prior Networks are a recently developed class of models which yield interpretable measures of uncertainty and have been shown to outperform state-of-the-art ensemble approaches on a range of tasks. They can also be used to distill an ensemble of models via Ensemble Distribution Distillation (EnD$^2$), such that its accuracy, calibration and uncertainty estimates are retained within a single model. However, Prior Networks have so far been developed only for classification tasks. This work extends Prior Networks and EnD$^2$ to regression tasks by considering the Normal-Wishart distribution. The properties of Regression Prior Networks are demonstrated on synthetic data, selected UCI datasets and a monocular depth estimation task, where they yield performance competitive with ensemble approaches.

研究动机与目标

  • 解决回归模型中可解释不确定性估计的缺失问题,这是自动驾驶等高风险AI应用中的关键需求。
  • 通过使用正态-Wishart分布对不确定性进行建模,将先前仅限于分类任务的先验网络扩展至回归任务。
  • 推导回归任务中总不确定性、数据不确定性和知识不确定性的闭式表达式,实现数学上一致的不确定性分解。
  • 提出两种训练范式:使用OOD数据的反向KL散度训练,以及EnD²蒸馏,以在无需OOD数据的情况下保留集成性能与不确定性。
  • 在真实回归任务中验证RPNs的有效性,特别是在单目深度估计中,其中不确定性校准至关重要。

提出的方法

  • 使用由神经网络参数化的多元正态分布建模预测分布,其中均值为μ,精度矩阵为Λ。
  • 采用正态-Wishart分布作为μ和Λ的共轭先验,实现闭式不确定性计算与高效推理。
  • 推导出总不确定性(预测分布的方差)、数据不确定性(认知方差)和知识不确定性(均值的认知方差)的解析表达式。
  • 通过模型的正态-Wishart分布与目标分布之间的反向KL散度进行RPN训练,需使用OOD数据进行监督。
  • 应用集成分布蒸馏(EnD²)将集成模型的预测性能与不确定性估计迁移至单个RPN中,无需使用OOD数据。
  • 使用EnD²目标函数最小化集成模型的预测分布与RPN预测分布之间的反向KL散度,以同时保留准确性和不确定性行为。

实验结果

研究问题

  • RQ1能否通过共轭先验分布成功将先验网络从分类任务扩展至回归任务?
  • RQ2能否基于正态-Wishart分布为回归任务推导出总不确定性、数据不确定性和知识不确定性的闭式表达式?
  • RQ3EnD²蒸馏是否能有效将集成模型的预测性能与不确定性估计迁移至单个RPN中,而无需使用OOD训练数据?
  • RQ4与最先进单模型及基于蒸馏的回归模型相比,采用EnD²的RPN在准确性和分布外检测方面表现如何?
  • RQ5在深度估计等对尺度敏感的回归任务中,基于方差的不确定性度量与基于信息论的不确定性度量的相对优势与局限性是什么?

主要发现

  • 回归先验网络(RPNs)成功将先验网络框架扩展至回归任务,采用正态-Wishart分布,实现了总不确定性、数据不确定性和知识不确定性的闭式计算。
  • 经EnD²蒸馏的RPN在NYUv2和KITTI单目深度估计基准上达到最先进性能,优于所有单模型及基于蒸馏的基线模型,在预测准确性和不确定性校准方面表现更优。
  • 在NYUv2数据集上,EnD² RPN使用基于方差的不确定性实现了99.9%的AUC-ROC OOD检测性能;而在KITTI上,对尺度不敏感的度量如MI和EPKL优于基于方差的方法,因其对低深度预测更不敏感。
  • 采用EnD²训练的模型在误差图与不确定性图上均与原始集成模型的不确定性行为高度一致,证明了不确定性特性的有效蒸馏。
  • 基于方差的不确定性度量在KITTI上失效,因其对尺度敏感——低深度预测导致不确定性被错误地低估;而基于信息论的度量如MI和EPKL则保持稳健。
  • 深度证据回归(DER)在KITTI上失败,因其证据正则化器会抑制低误差区域的不确定性,导致近摄像头的OOD样本被错误分类为分布内样本。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。