Skip to main content
QUICK REVIEW

[论文解读] Sampling Techniques in Bayesian Target Encoding

Michael Larionov|arXiv (Cornell University)|Jun 1, 2020
Bayesian Modeling and Causal Inference参考文献 5被引用 8
一句话总结

该论文提出了一种新型的分类变量编码方法——采样贝叶斯编码器(Sampling Bayesian Encoder),通过从目标统计量的后验分布中采样,而非使用固定的矩统计量,来提升泛化能力并减少目标泄漏。该方法在合成数据集和真实世界数据集上均优于传统的目标编码和贝叶斯目标编码,实现了更高的准确率,并具备更优的特征重要性校准能力。

ABSTRACT

Target encoding is an effective encoding technique of categorical variables and is often used in machine learning systems for processing tabular data sets with mixed numeric and categorical variables. Recently en enhanced version of this encoding technique was proposed by using conjugate Bayesian modeling. This paper presents a further development of Bayesian encoding method by using sampling techniques, which helps in extracting information from intra-category distribution of the target variable, improves generalization and reduces target leakage.

研究动机与目标

  • 通过利用贝叶斯推断,解决传统目标编码中的目标泄漏和过拟合问题。
  • 通过捕捉类别内部目标分布的完整信息(而不仅限于均值),提升高基数分类变量的泛化能力。
  • 提出一种理论基础坚实的、基于采样的替代方法,以取代基于矩统计量的贝叶斯目标编码。
  • 通过采样自然探索参数空间,减少对启发式噪声注入的依赖。
  • 在多种机器学习模型上,对合成数据集和真实世界数据集进行实证验证。

提出的方法

  • 该方法使用共轭先验对每个类别的目标变量分布进行建模,并利用训练数据更新以获得后验分布。
  • 与使用后验分布前Q阶矩不同,该方法从后验分布中采样以生成编码表示。
  • 编码函数 f(θ) 将后验参数映射到Q维空间,支持灵活的表征学习。
  • 通过K个后验样本的蒙特卡洛平均估计模型预测:ŷ(xₙ) ≈ (1/K)Σŷ_θ(ξₙ, f₁(θₙ₁ᵏ), ..., fₘ(θₙₘᵏ))。
  • 在训练和推理过程中均进行采样,每个样本生成K个样本,有效将数据集规模扩大至K×N。
  • 该方法适用于任意预测模型,并可通过选择不同的f(θ)实现自适应特征工程,例如多项式或证据权重(weight of evidence)形式。

实验结果

研究问题

  • RQ1在贝叶斯目标编码中,从后验分布中采样是否能比使用固定矩统计量带来更好的泛化性能?
  • RQ2与标准目标编码和LeaveOneOutEncoder相比,所提出的基于采样的方法是否能有效减少目标泄漏?
  • RQ3采样数量K对模型性能和训练效率有何影响?
  • RQ4映射函数f(θ)的选择在多大程度上影响模型性能,尤其是在表达能力较弱的模型中?
  • RQ5先验缩放因子γ如何影响模型鲁棒性,特别是在稀有类别上的表现?

主要发现

  • 在make_classification数据集上,采样贝叶斯编码器在随机森林模型上达到0.6595的准确率,略高于最佳LeaveOneOutEncoder模型的0.6585。
  • 在make_hastie_10_2数据集上,该方法准确率达到0.8229,优于LeaveOneOutEncoder基线模型的0.8217。
  • 在Adult数据集上,该方法准确率达到0.8652,高于最佳LeaveOneOutEncoder模型的0.8647。
  • 在梅赛德斯-奔驰数据集上,该方法的R²得分为0.61135,优于LeaveOneOutEncoder的0.60974。
  • 特征重要性分析显示,使用采样贝叶斯编码器的模型显著降低了对分类特征的重要性分配,表明目标泄漏减少。
  • 在竞赛设置下,该方法在公开和私有测试集上均表现出更优性能,证实其对未见数据具有更好的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。