[论文解读] PROMISSING: Pruning Missing Values in Neural Networks
PROMISSING 提出了一种新颖的方法,通过将缺失值视为不确定性的信息性信号而非错误,利用可学习的表征来中和其对激活的影响,从而处理神经网络中的缺失值。该方法在性能上可与插补技术相媲美,同时使模型在面对更多缺失数据时逐渐表现出犹豫不决——更贴近人类的不确定性意识。
While data are the primary fuel for machine learning models, they often suffer from missing values, especially when collected in real-world scenarios. However, many off-the-shelf machine learning models, including artificial neural network models, are unable to handle these missing values directly. Therefore, extra data preprocessing and curation steps, such as data imputation, are inevitable before learning and prediction processes. In this study, we propose a simple and intuitive yet effective method for pruning missing values (PROMISSING) during learning and inference steps in neural networks. In this method, there is no need to remove or impute the missing values; instead, the missing values are treated as a new source of information (representing what we do not know). Our experiments on simulated data, several classification and regression benchmarks, and a multi-modal clinical dataset show that PROMISSING results in similar prediction performance compared to various imputation techniques. In addition, our experiments show models trained using PROMISSING techniques are becoming less decisive in their predictions when facing incomplete samples with many unknowns. This finding hopefully advances machine learning models from being pure predicting machines to more realistic thinkers that can also say "I do not know" when facing incomplete sources of information.
研究动机与目标
- 解决现实世界机器学习中缺失数据的挑战,特别是在数据收集成本高且不完整的临床和多模态场景中。
- 克服传统插补方法的局限性,后者假设缺失数据机制,可能引入偏差或需要大量预处理。
- 开发一种方法,使神经网络能够自然地处理缺失值,而无需插补或删除,同时保持模型的鲁棒性与可解释性。
- 使模型在面对不完整输入时能够表达不确定性,从而更贴近人类在不确定环境中的推理方式。
- 通过将缺失值作为工具来探测个体患者层面的特征重要性,实现模型决策的反事实解释。
提出的方法
- 引入一种可学习的缺失值表征,在前向传播过程中应用,以中和其对神经元激活的影响。
- 修改神经网络的前向传播过程,将缺失值(NaN)视为一种独立的输入类型,使用可学习嵌入来表示信息的缺失。
- 应用剪枝机制,抑制缺失特征对神经元激活的贡献,从而有效‘剪除’其影响。
- 使用标准反向传播进行端到端训练,使网络能够学习在何时以及如何降低不确定输入的权重。
- 通过在每种模态上独立应用相同机制,将该方法扩展至多模态数据,实现对混合数据类型(连续、二值、分类)的灵活处理。
- 通过人为将特征标记为缺失,实现反事实解释,以评估其对预测的影响,从而在个体层面上提供局部可解释性。
实验结果
研究问题
- RQ1是否可以训练神经网络直接处理缺失值,而无需插补或删除,同时保持预测性能?
- RQ2在使用 PROMISSING 与基于插补的方法时,随着缺失值数量的增加,模型预测的置信度如何变化?
- RQ3PROMISSING 是否能通过人工缺失性分析实现更可解释且更具临床意义的模型决策?
- RQ4PROMISSING 是否通过在信息不完整时反映预测中的不确定性,从而改善模型校准?
- RQ5PROMISSING 在多样化数据类型及具有高维、多模态、不完整特征的真实临床数据集中的表现如何?
主要发现
- PROMISSING 在分类和回归基准测试中,性能与多种插补技术(包括 MICE 和深度生成模型)相当。
- 使用 PROMISSING 训练的模型随着缺失值数量的增加,预测结果逐渐趋于 0.5(随机猜测),表现出单调收敛,反映了校准后的不确定性。
- mPROMISSING 变体(引入缺失性可学习嵌入)修正了标准 PROMISSING 中观察到的与随机猜测的微小偏差,提升了可靠性。
- PROMISSING 支持有效的反事实解释:通过将特征人为标记为缺失,该方法揭示了哪些模态(如 PANSS、MINI)对模型决策最具影响力。
- 在临床应用中,PROMISSING 通过回答个体患者层面的“为什么”问题,支持可解释人工智能,增强了精准精神病学中的信任度与实用性。
- 该方法在数据类型(连续、二值、分类)上具有灵活性,且无需数据预处理,适用于无需额外工程的复杂多模态数据集。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。