[论文解读] A benchmark of categorical encoders for binary classification
本论文提出了迄今为止最全面的二分类任务中类别编码器的基准测试,评估了32种编码器配置在50个数据集、五种机器学习模型、四种评估指标、三种超参数调优策略以及十种聚合方法下的表现。结果表明,编码器性能对实验因素极为敏感,其排名在不同模型选择、评估指标和聚合策略下存在显著差异,挑战了以往基于更窄范围研究的结论,并强调在编码器评估中需要更广泛的实验设计。
Categorical encoders transform categorical features into numerical representations that are indispensable for a wide range of machine learning models. Existing encoder benchmark studies lack generalizability because of their limited choice of (1) encoders, (2) experimental factors, and (3) datasets. Additionally, inconsistencies arise from the adoption of varying aggregation strategies. This paper is the most comprehensive benchmark of categorical encoders to date, including an extensive evaluation of 32 configurations of encoders from diverse families, with 36 combinations of experimental factors, and on 50 datasets. The study shows the profound influence of dataset selection, experimental factors, and aggregation strategies on the benchmark's conclusions -- aspects disregarded in previous encoder benchmarks.
研究动机与目标
- 为解决现有类别编码器基准测试缺乏泛化能力的问题,这些基准通常使用有限的数据集、不一致的评估指标,以及不清晰的超参数调优或聚合策略。
- 评估实验因素(如机器学习模型、评估质量指标、调优策略和聚合方法)对编码器性能排名的影响。
- 在多样化实验设置下,识别并推荐最稳健的编码器配置,尤其针对决策树和逻辑回归模型。
- 使用 ρ-可复现性(ρ-replicability)和 J-可复现性(J-replicability)量化结果的可复现性,表明不同模型和数据集样本下结果存在显著差异。
- 提供一个公开可用的基准框架,以支持未来研究中可复现且可比较的编码器评估。
提出的方法
- 本研究在来自不同领域的50个二分类数据集上,评估了32种编码器配置,包括最先进和新型编码器。
- 采用五种广泛使用的机器学习模型:逻辑回归、随机森林、梯度提升、k-最近邻(k-NN)和支持向量机(SVM),并应用三种不同的调优策略:无调优、模型调优和完整流水线调优。
- 使用四种评估指标——ROC AUC、平衡准确率、准确率和精确率-召回率AUC——以确保多维度的评估。
- 应用十种聚合策略,包括Friedman-Nemenyi、Kemeny-Young和启发式排序,以推导共识排名并评估后处理方法对结果的影响。
- 通过 ρ-可复现性(排名的Spearman相关系数)和 J-可复现性(top-k集合的Jaccard相似度)量化可复现性,从而实现对不同实验条件下一致性结果的统计验证。
- 所有实验均采用标准化预处理,代码已公开发布,以确保可复现性,并便于未来基准测试。

实验结果
研究问题
- RQ1不同实验因素(如机器学习模型、评估指标、调优策略和聚合方法)如何影响类别编码器的排名?
- RQ2类别编码器的性能在不同数据集和实验配置下,其可复现性程度如何?
- RQ3在多种模型和评估指标下,哪些编码器配置能持续优于其他配置,特别是针对树模型和线性模型?
- RQ4聚合策略如何影响编码器的共识排名,其对基准测试结果解释有何影响?
- RQ5为何先前研究对最佳编码器的结论存在冲突?这种差异是否可由实验设计差异加以解释?
主要发现
- 编码器性能对机器学习模型的选择极为敏感,其中逻辑回归表现出最高的可复现性(ρ-可复现性),而决策树的可复现性最低。
- 对于决策树模型,Weight of Evidence(WoE)始终排名第一,但统计检验未显示其与其它编码器存在显著差异。
- 对于逻辑回归模型,Sum、One-Hot、Binary 和 Weight of Evidence 的排名显著优于其他编码器,且通过t检验确认了统计显著性。
- 相似性编码器如Min-hash和One-Hot在t检验中未表现出显著性能差异(显著性水平α=0.05),与早期声称其优越性的结论相矛盾。
- Kemeny-Young和Friedman-Nemenyi等聚合策略产生了明显不同的共识排名,凸显了后处理方法对基准结果解释的关键影响。
- 可复现性度量显示,更大的数据集样本可提高结果可靠性,但该趋势在J-可复现性中并不一致,表明排名一致性存在复杂依赖关系。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。