[论文解读] Handling Missing Data in Decision Trees: A Probabilistic Approach
本文提出一种概率框架,用于在决策树中处理缺失数据,利用可 tractable 密度估计器在推理时计算期望预测,在学习时通过最小化期望损失实现优化。通过利用概率推理隐式填补缺失值并微调树参数,该方法在高缺失率下显著优于标准插补方法和 XGBoost 的默认处理方式。
Decision trees are a popular family of models due to their attractive properties such as interpretability and ability to handle heterogeneous data. Concurrently, missing data is a prevalent occurrence that hinders performance of machine learning models. As such, handling missing data in decision trees is a well studied problem. In this paper, we tackle this problem by taking a probabilistic approach. At deployment time, we use tractable density estimators to compute the "expected prediction" of our models. At learning time, we fine-tune parameters of already learned trees by minimizing their "expected prediction loss" w.r.t.\ our density estimators. We provide brief experiments showcasing effectiveness of our methods compared to few baselines.
研究动机与目标
- 解决决策树中缺失数据的挑战,尽管决策树以能处理此类情况著称,但缺失数据仍常导致模型性能下降。
- 将树结构学习与联合特征分布建模解耦,实现对缺失值更灵活且更合理的处理。
- 通过使用可 tractable 密度估计器对所有可能的缺失数据补全进行积分,计算期望预测,从而在部署时提升模型鲁棒性。
- 通过在学习阶段基于缺失数据下的期望损失最小化来微调树参数,而非依赖启发式插补方法,从而提升训练阶段性能。
- 提供一种统一且基于概率原理的方法,适用于不同树算法及多种缺失机制。
提出的方法
- 使用可 tractable 概率电路(PCs)建模输入特征的联合分布 $ p(\textbf{X}) $,实现高效的边缘推断。
- 在部署阶段,通过在所有可能的缺失特征补全上积分,并按其在 $ p(\textbf{X}) $ 下的似然加权,计算树的期望预测。
- 在学习阶段,通过在完整分布上最小化期望预测损失(如 MSE),而非仅基于观测数据,重新训练树参数。
- 推导出在期望损失下最优叶节点参数的闭式解,从而实现对预训练树(如 XGBoost 中的树)的高效微调。
- 将树结构学习与分布学习解耦,使该方法可后处理地应用于任意现有树或森林。
- 在实验中使用 MCAR(完全随机缺失)假设,以在受控缺失条件下评估性能。
实验结果
研究问题
- RQ1当缺失数据仅在部署阶段出现时,基于概率推理的期望预测是否能提升决策树性能?
- RQ2当训练和推理阶段均存在缺失值时,学习阶段的期望损失最小化是否能提升决策树的鲁棒性?
- RQ3在不同缺失率下,该方法与标准插补技术(如中位数插补)和默认树处理方式(如 XGBoost 的默认分支)相比表现如何?
- RQ4当训练与部署阶段的缺失机制不同时,该方法是否仍能保持或提升性能?
- RQ5该框架能否扩展以支持具有理论一致性保证的结构化树学习?
主要发现
- 当缺失数据仅在部署阶段出现时,期望预测显著优于 XGBoost 的默认处理方式和中位数插补,尤其在高缺失率下(如 π = 0.9)表现更优。
- 当缺失数据在训练和部署阶段均存在时,期望预测在缺失率不超过 40% 时与 XGBoost 的原生处理方式表现相当,但被期望损失微调方法超越。
- 期望损失最小化带来显著的性能提升,尤其在训练阶段存在缺失时,表明基于期望损失的微调能改善泛化能力。
- 该方法优于中位数插补的原因在于其能建模特征间的依赖关系,而中位数插补假设特征间相互独立。
- 通过期望损失对 XGBoost 树进行微调,其 RMSE 优于标准训练,证明即使在树结构固定后,概率重训练仍具显著价值。
- 该框架与树结构无关,可后处理地应用于现有模型,实现无需从头开始训练的鲁棒性增强。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。