[论文解读] Semi-Supervised Learning with Normalizing Flows
本文提出 FlowGMM,一种基于归一化流与潜在高斯混合模型的新型半监督学习方法,通过精确似然联合建模有标签与无标签数据。该方法支持端到端训练,具备可解释的决策边界、实时特征可视化能力,并在文本、表格和图像数据上表现优异,尤其在生成建模与可解释性方面超越判别性基线方法。
Normalizing flows transform a latent distribution through an invertible neural network for a flexible and pleasingly simple approach to generative modelling, while preserving an exact likelihood. We propose FlowGMM, an end-to-end approach to generative semi supervised learning with normalizing flows, using a latent Gaussian mixture model. FlowGMM is distinct in its simplicity, unified treatment of labelled and unlabelled data with an exact likelihood, interpretability, and broad applicability beyond image data. We show promising results on a wide range of applications, including AG-News and Yahoo Answers text data, tabular data, and semi-supervised image classification. We also show that FlowGMM can discover interpretable structure, provide real-time optimization-free feature visualizations, and specify well calibrated predictive distributions.
研究动机与目标
- 开发一种统一的、端到端的生成式半监督学习框架,将有标签与无标签数据统一建模于单一概率模型下,并实现精确似然。
- 通过利用归一化流的可逆结构以及潜在空间中的高斯混合模型,提升模型的可解释性与透明度。
- 通过可逆的中间激活实现无需优化的实时特征可视化,增强模型可解释性。
- 证明该方法在图像数据之外的广泛适用性,包括文本与表格数据集,而这些领域中一致性方法通常表现不佳。
- 验证决策边界位于数据空间的低密度区域,符合半监督学习中的聚类原则。
提出的方法
- FlowGMM 使用可逆神经网络(归一化流)将数据从输入空间映射到潜在空间,在该空间中分布被建模为每个类别对应一个分量的高斯混合模型。
- 通过在流变换后的潜在分布下最大化有标签与无标签数据的精确联合似然,实现端到端训练。
- 分类通过使用流网络计算输入的潜在表示,并将类别分配给与该表示最近的高斯混合分量均值来完成。
- 通过扰动流网络中的中间激活并直接反向映射回数据空间,无需迭代优化,实现特征可视化,支持实时探索。
- 利用流的可逆性,直接操控并可视化潜在空间中特定神经元或通道的影响。
- 决策边界由潜在空间中两个类别条件分量均值连线的垂直平分线隐式定义,自然倾向于低密度区域。
实验结果
研究问题
- RQ1基于归一化流的模型能否在有标签与无标签数据上实现具有精确似然的端到端半监督学习?
- RQ2FlowGMM 的潜在高斯混合结构是否使决策边界位于数据空间的低密度区域,符合聚类原则的预测?
- RQ3归一化流的可逆结构能否实现无需优化的实时特征可视化,从而揭示模型行为?
- RQ4在表格与文本数据上,FlowGMM 与一致性方法及图神经网络方法相比表现如何,后者在这些领域常表现不佳?
- RQ5FlowGMM 在跨多种数据模态的潜在空间中,能在多大程度上发现可解释且解耦的表示?
主要发现
- FlowGMM 显著减少了位于决策边界附近(距离 ≤5)的无标签数据点数量——在 FlowGMM-cons 中仅有 143 个点,而监督基线中为 1089 个,验证了聚类原则。
- 该模型生成了校准良好的预测分布,并通过直接反演中间流层中的扰动(无需优化)实现了实时特征可视化。
- FlowGMM 在使用 BERT 嵌入的半监督文本分类任务以及在一致性方法通常失效的表格数据上,均优于一致性与图神经网络基线方法。
- 该方法成功从模型中生成了真实感强的数据空间样本,展示了其在图像、文本与表格领域均具备生成能力。
- 潜在空间结构揭示了可解释的聚类:有标签数据被映射到对应的高斯混合分量,且决策边界位于低密度区域。
- 特征可视化显示,特定通道在零像素模式(如随机平移产生的零值区域)与颜色通道上被激活,揭示了学习到的表征机制。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。