Skip to main content
QUICK REVIEW

[论文解读] Bayesian Semisupervised Learning with Deep Generative Models

Jonathan Gordon, José Miguel Hernández-Lobato|arXiv (Cornell University)|Jun 29, 2017
Gaussian Processes and Bayesian Inference参考文献 17被引用 16
一句话总结

该论文提出了一种基于深度生成模型的贝叶斯半监督学习框架,采用全贝叶斯神经网络(BNN)作为判别组件,实现不确定性感知的预测。通过引入随机输入并使用吉布斯采样进行后验推断,该模型同时捕捉了数据和参数的不确定性,在合成数据上相较于点估计基线方法在准确率和不确定性校准方面表现更优。

ABSTRACT

Neural network based generative models with discriminative components are a powerful approach for semi-supervised learning. However, these techniques a) cannot account for model uncertainty in the estimation of the model's discriminative component and b) lack flexibility to capture complex stochastic patterns in the label generation process. To avoid these problems, we first propose to use a discriminative component with stochastic inputs for increased noise flexibility. We show how an efficient Gibbs sampling procedure can marginalize the stochastic inputs when inferring missing labels in this model. Following this, we extend the discriminative component to be fully Bayesian and produce estimates of uncertainty in its parameter values. This opens the door for semi-supervised Bayesian active learning.

研究动机与目标

  • 解决现有深度生成模型在半监督学习中缺乏模型不确定性量化的问题。
  • 将贝叶斯神经网络扩展至高维潜在空间,引入随机输入以提升标签生成的灵活性。
  • 通过显式建模潜在变量和模型参数的不确定性,实现半监督学习与主动学习的联合支持。
  • 开发一种高效的推断过程,在预测时对随机输入和后验权重进行边缘化处理。
  • 证明不确定性感知的预测可提升泛化能力与置信度校准,尤其在低数据量场景下表现更优。

提出的方法

  • 提出一种深度生成模型,其中标签通过具有随机输入的BNN生成,从而实现对标签不确定性的灵活建模。
  • 使用编码网络从输入 $ x $ 推断潜在变量 $ z $,实现可扩展的后验近似。
  • 采用吉布斯采样迭代采样 $ y_* $、$ z $ 和 $ W_y $,其中 $ y_* $ 初始化为编码网络 $ q_\phi(y_*|x_*) $ 的输出,以避免预 burn-in 阶段。
  • 对 $ W_y $ 和 $ z $ 均应用重参数化技巧,实现高效的变分推断,通过最小化 $ \alpha $-散度来优化证据下界(ELBO)。
  • 利用 $ W_y $ 和 $ z $ 的完整后验分布计算预测分布,实现对预测结果的不确定性量化。
  • 采用联合变分目标,同时结合有标签和无标签数据,其中 $ \alpha = 0.1 \times N_l $ 以平衡两部分贡献。

实验结果

研究问题

  • RQ1与确定性或点估计基线相比,具有随机输入的贝叶斯神经网络是否能提升半监督学习中的不确定性量化性能?
  • RQ2所提出的对随机输入进行边缘化的吉布斯采样过程如何影响预测性能与不确定性校准?
  • RQ3该模型是否能通过在模型权重和潜在变量上进行完整后验推断,同时支持半监督学习与主动学习?
  • RQ4在BNN组件中引入随机输入是否能带来更平滑的决策边界,并在低标注数据量场景下实现更好的泛化能力?
  • RQ5在分布外区域,该模型的预测不确定性与标准深度生成模型相比如何?

主要发现

  • 所提出的SSLAPD方法在测试集上达到99.7%的准确率和-0.01的对数似然值,显著优于DNN(83.6%准确率,-1.20对数似然值)和SSLPE(99.2%准确率,-0.07对数似然值)。
  • 在远离训练数据的区域,SSLAPD产生了更宽的置信区间带,表明其不确定性校准优于忽略参数不确定性的方法。
  • 当 $ N_l > 10 $ 时,模型在所有测试集上均收敛至100%准确率,且随着标注集大小增加,收敛速度更快,ELBO值更高。
  • 通过 $ q_\phi(y_*|x_*) $ 初始化吉布斯采样,实现了无需预 burn-in 的高效推断,仅用 $ T = 10 $ 次采样即可获得稳定预测。
  • 该模型成功生成了逼真的样本,表明其生成过程能有效捕捉数据的底层分布。
  • 引入随机输入并使用 $ W_y $ 的完整后验分布,显著提升了决策边界的平滑性与鲁棒性,尤其在低数据量场景下表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。