Skip to main content
QUICK REVIEW

[论文解读] Semi-Conditional Normalizing Flows for Semi-Supervised Learning

Andrei Atanov, Alexandra Volokhova|arXiv (Cornell University)|May 1, 2019
Domain Adaptation and Few-Shot Learning参考文献 30被引用 22
一句话总结

本文提出半条件归一化流(SCNF),一种深度生成模型,通过半条件架构的归一化流联合建模数据与标签分布。通过采用条件耦合层和多尺度流架构,SCNF 实现了对未标记数据的精确似然优化与高效边缘似然计算,在 MNIST 上达到最先进性能,并优于半监督 VAE。

ABSTRACT

This paper proposes a semi-conditional normalizing flow model for semi-supervised learning. The model uses both labelled and unlabeled data to learn an explicit model of joint distribution over objects and labels. Semi-conditional architecture of the model allows us to efficiently compute a value and gradients of the marginal likelihood for unlabeled objects. The conditional part of the model is based on a proposed conditional coupling layer. We demonstrate performance of the model for semi-supervised classification problem on different datasets. The model outperforms the baseline approach based on variational auto-encoders on MNIST dataset.

研究动机与目标

  • 通过利用大规模未标记数据,解决监督学习中标签数据有限的挑战。
  • 开发一种深度生成模型,实现对已标记与未标记数据的可 tractable 联合似然估计。
  • 设计一种支持半监督设置下未标记样本高效边缘似然计算的归一化流架构。
  • 探究归一化流是否能隐式学习到对半监督学习有用的解耦、非判别性表征。
  • 在标准半监督分类基准上评估模型性能,并与现有方法(如半监督 VAE)进行比较。

提出的方法

  • 该模型采用半条件归一化流架构,将流变换条件化于类别标签,实现对 $ p_{\theta}(x,y) $ 的联合建模。
  • 提出一种新型条件耦合层,扩展标准耦合层以支持标签条件化的变换,并保持可 tractable 的雅可比行列式。
  • 多尺度流架构降低潜在维度,同时保留语义信息,实现对未标记数据的高效边缘似然计算。
  • 联合似然 $ p_{\theta}(x,y) $ 被分解为 $ p_{\theta}(x|y)p(y) $,其中 $ p(y) $ 为均匀先验,$ p_{\theta}(x|y) $ 通过条件流建模。
  • 未标记数据的边缘似然 $ p_{\theta}(x) $ 通过在所有类别上求和计算,利用可 tractable 的变量变换公式。
  • 该模型支持对精确对数似然目标(1)的端到端优化,避免使用变分近似。

实验结果

研究问题

  • RQ1通过以可 tractable 似然建模联合分布 $ p_{\theta}(x,y) $,归一化流能否被有效适配于半监督学习?
  • RQ2半条件流架构是否能实现对未标记数据边缘似然的高效且精确计算?
  • RQ3来自条件流的潜在表征 $ z_h $ 是否能与类别标签 $ y $ 解耦,从而作为非判别性表征?
  • RQ4在分类准确率与似然优化稳定性方面,该模型与半监督 VAE 相比表现如何?
  • RQ5该模型的架构是否具有内在的数据混淆机制,且该机制能否用于公平或鲁棒学习?

主要发现

  • 所提出的 SCNF 模型在 MNIST 数据集上优于基线半监督 VAE(Kingma 等,2014),表现出更优的分类准确率。
  • 该模型实现了精确的似然优化,无需依赖变分推断,可直接最大化对数似然目标。
  • 来自条件流的潜在表征 $ z_h $ 与类别标签 $ y $ 独立,表明判别性与非判别性特征被有效解耦。
  • t-SNE 可视化证实 $ z_h $ 表征具有类别无关性,而 $ z_f $ 表征仍高度依赖于 $ y $。
  • 由于流结构的设计,该模型表现出内在的数据混淆机制,可能有益于半监督公平学习。
  • 在更复杂的数据集上,通过在隐藏流组件上引入分类损失可提升模型性能,但数据增强方法仍表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。