Skip to main content
QUICK REVIEW

[论文解读] Information-Theoretic Analysis of Epistemic Uncertainty in Bayesian Meta-learning

Sharu Theresa Jose, Sangwoo Park|arXiv (Cornell University)|Jun 1, 2021
Gaussian Processes and Bayesian Inference参考文献 41被引用 4
一句话总结

本文对贝叶斯元学习中的认识论不确定性进行了信息论分析,利用条件互信息推导出最小超额元风险(MEMR)的精确表征与边界。结果表明,由于超参数不确定性导致的认识论不确定性量级为 $ O(d/\log(N)/N) $,由于模型参数不确定性导致的则为 $ O(d/\log(m)/m) $,实验结果证实当每任务数据有限时元学习可降低不确定性,但当数据充足时则无法实现显著降低。

ABSTRACT

The overall predictive uncertainty of a trained predictor can be decomposed into separate contributions due to epistemic and aleatoric uncertainty. Under a Bayesian formulation, assuming a well-specified model, the two contributions can be exactly expressed (for the log-loss) or bounded (for more general losses) in terms of information-theoretic quantities (Xu and Raginsky, 2020). This paper addresses the study of epistemic uncertainty within an information-theoretic framework in the broader setting of Bayesian meta-learning. A general hierarchical Bayesian model is assumed in which hyperparameters determine the per-task priors of the model parameters. Exact characterizations (for the log-loss) and bounds (for more general losses) are derived for the epistemic uncertainty -quantified by the minimum excess meta-risk (MEMR)- of optimal meta-learning rules. This characterization is leveraged to bring insights into the dependence of the epistemic uncertainty on the number of tasks and on the amount of per-task training data. Experiments are presented that use the proposed information-theoretic bounds, evaluated via neural mutual information estimators, to compare the performance of conventional learning and meta-learning as the number of meta-learning tasks increases.

研究动机与目标

  • 将信息论不确定性分解方法从传统贝叶斯学习扩展至贝叶斯元学习。
  • 在对数损失下,利用最小超额元风险(MEMR)表征元学习中的认识论不确定性。
  • 量化认识论不确定性如何依赖于元训练任务数 $ N $ 和每任务数据量 $ m $。
  • 在贝叶斯神经网络设置下,使用神经互信息估计器(如 C-MINE)评估所提出的边界。
  • 随着 $ N $ 增大,比较传统学习与元学习的性能,识别元学习提供优势的区域。

提出的方法

  • 通过包含超参数 $ U $、每任务参数 $ W $ 和任务特定数据 $ \mathbf{Z} $ 的层次化模型形式化贝叶斯元学习,假设模型设定正确。
  • 为对数损失推导出 MEMR 的精确信息论表征,其为两项条件互信息之和:$ I(Y;W|X,\mathbf{Z},U) $ 和 $ I(Y;U|X,\mathbf{Z}_{1:N}) $。
  • 利用信息论工具为一般损失函数建立 MEMR 的上界,推广了最小超额风险(MER)概念。
  • 提出使用神经估计器(特别是 C-MINE 和 SMILE)估计相关条件互信息项,以在实验中评估边界。
  • 设计基于贝叶斯神经网络(BNNs)的实验,比较不同 $ N $ 和 $ m $ 下的 MEMR 及其边界,采用具有 ReLU 激活函数的三层 MLP。
  • 在 C-MINE 中使用带 ReLU 激活函数的三层分类器与 Adam 优化器,估计模型参数与训练数据之间的互信息。

实验结果

研究问题

  • RQ1在贝叶斯元学习中,认识论不确定性如何随元训练任务数 $ N $ 和每任务数据量 $ m $ 变化?
  • RQ2在层次化贝叶斯模型中,最小超额元风险(MEMR)的信息论结构是什么?
  • RQ3在何种情况下元学习相较于传统学习能显著降低认识论不确定性?
  • RQ4随着 $ N $ 和 $ m $ 增大,超参数层级与模型参数层级的不确定性对 MEMR 的贡献如何演变?
  • RQ5神经互信息估计器是否能准确评估在 BNN 设置下推导出的信息论边界?

主要发现

  • 由超参数不确定性引起的认识论不确定性量级为 $ O(d\log(N)/N) $,随元训练任务数增加而减小。
  • 由模型参数不确定性引起的认识论不确定性量级为 $ O(d\log(m)/m) $,随每任务数据量增加而减小。
  • 当每任务数据 $ m $ 较少时(例如 $ m < 10 $),超参数层级的敏感性占主导,且在 $ N $ 较大时元学习可显著降低 MEMR。
  • 当每任务数据 $ m $ 较多时(例如 $ m > 75 $),模型参数层级的敏感性占主导,增加 $ N $ 对传统学习的改进微乎其微。
  • 在 $ N $ 极大时 MEMR 仍不趋近于零,这是由于每任务数据 $ m $ 有限导致的持续不确定性,该不确定性与 $ N $ 无关。
  • 使用 C-MINE 和 SMILE 估计器的实验结果表明,MEMR 及其上界随 $ N $ 和 $ m $ 增加而减小,且在所有情形下边界均紧密跟踪真实 MEMR。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。