[论文解读] Semi-supervised Learning with Missing Values Imputation
本文提出半监督条件归一化流(SSCFlow),一种联合填补与分类框架,利用标签信息提升缺失值估计与分类准确率。通过使用半监督归一化流建模不完整样本的条件分布,并利用去噪自编码器迭代优化受损填补结果,SSCFlow 在多个含缺失值的真实世界数据集上实现了最先进性能。
Incomplete instances with various missing attributes in many real-world applications have brought challenges to the classification tasks. Missing values imputation methods are often employed to replace the missing values with substitute values. However, this process often separates the imputation and classification, which may lead to inferior performance since label information are often ignored during imputation. Moreover, traditional methods may rely on improper assumptions to initialize the missing values, whereas the unreliability of such initialization might lead to inferior performance. To address these problems, a novel semi-supervised conditional normalizing flow (SSCFlow) is proposed in this paper. SSCFlow explicitly utilizes the label information to facilitate the imputation and classification simultaneously by estimating the conditional distribution of incomplete instances with a novel semi-supervised normalizing flow. Moreover, SSCFlow treats the initialized missing values as corrupted initial imputation and iteratively reconstructs their latent representations with an overcomplete denoising autoencoder to approximate their true conditional distribution. Experiments on real-world datasets demonstrate the robustness and effectiveness of the proposed algorithm.
研究动机与目标
- 解决传统两步法填补-分类流程在填补阶段忽略标签信息的局限性。
- 克服现有方法因缺失值初始化不可靠导致的性能低下问题。
- 通过联合优化条件分布估计,同时提升填补与分类性能。
- 通过在生成过程中引入标签先验,实现对同时包含有标签与无标签样本的不完整数据的有效学习。
- 开发一种稳健框架,将缺失值视为受损特征,利用半监督潜在空间建模进行重建。
提出的方法
- 提出一种半监督条件归一化流(SSCFlow),用于估计给定标签的不完整样本的条件分布。
- 将观测到的标签作为额外特征引入归一化流,以联合引导填补与分类。
- 将未观测到的标签视为缺失值,并作为端到端训练过程的一部分进行重建。
- 使用过完备的去噪自编码器,迭代重建受损的完整特征,近似缺失值的真实条件分布。
- 在归一化流中采用可逆变换,实现精确似然估计,并支持从条件分布中高效采样。
- 在填补与分类分支之间共享参数,实现特征与权重共享,提升泛化能力与一致性。

实验结果
研究问题
- RQ1是否可通过条件分布估计实现联合填补与分类,从而超越传统两步法?
- RQ2在填补过程中引入标签信息如何影响缺失值估计质量与下游分类准确率?
- RQ3与单步填补相比,对受损填补结果的迭代重建在多大程度上提升性能?
- RQ4使用半监督条件归一化流是否能实现更优的决策边界分离与潜在空间可解释性?
- RQ5SSCFlow 的不同组件(如 IDM、IT、LS)对整体性能的贡献如何?哪些最为关键?
主要发现
- 在所有测试数据集上,SSCFlow 的分类准确率(ACC)均最高,尤其在 HTRU2 数据集上显著优于 MCFlow 与其他最先进方法(0.9686 ± 0.5218 vs. 0.9602 ± 0.0020)。
- 在乳腺癌数据集上,SSCFlow 达到 98.37% ± 0.0082 的准确率,显著优于第二名方法(93.85% ± 0.0135)。
- 通过 MDS 可视化显示,SSCFlow 生成的潜在空间表征展现出更清晰的类别可分性与更自然的聚类边界,表明其可解释性得到提升。
- 消融实验确认,SSCFlow 的所有组件(IDM、IT、LS)均对性能有贡献,其中 SSCFlow-LS 在填补任务中表现最差,表明标签影响必须作用于生成过程,而不仅限于损失函数。
- XGBoost(直接对不完整数据进行分类,不进行填补)在大多数数据集上表现最差,支持了忽略缺失值分布会降低性能的论断。
- 该模型在多样化的现实世界数据集(包括银行票据、传感器无标签、WiFi 定位等)上表现出稳健性,且在填补与分类任务中均保持一致的性能提升。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。