Skip to main content
QUICK REVIEW

[论文解读] A Comparison of Machine Learning Methods for Data with High-Cardinality Categorical Variables

Fabio Sigrist|arXiv (Cornell University)|Jul 5, 2023
Forecasting Techniques and ApplicationsDecision Sciences被引用 3
一句话总结

本文比较了处理高基数分类变量的表格数据机器学习方法,评估了树提升、深度神经网络以及带随机效应和不带随机效应的线性混合效应模型。研究发现,引入随机效应能显著提升预测准确率,且带随机效应的树提升模型在多个数据集上优于带随机效应的深度神经网络。

ABSTRACT

High-cardinality categorical variables are variables for which the number of different levels is large relative to the sample size of a data set, or in other words, there are few data points per level. Machine learning methods can have difficulties with high-cardinality variables. In this article, we empirically compare several versions of two of the most successful machine learning methods, tree-boosting and deep neural networks, and linear mixed effects models using multiple tabular data sets with high-cardinality categorical variables. We find that, first, machine learning models with random effects have higher prediction accuracy than their classical counterparts without random effects, and, second, tree-boosting with random effects outperforms deep neural networks with random effects.

研究动机与目标

  • 评估机器学习模型在包含高基数分类变量的表格数据集上的表现。
  • 探究在这些数据中引入随机效应是否能提升预测准确率。
  • 从预测性能和计算效率两方面,比较树提升、深度神经网络和线性混合效应模型的表现。
  • 评估不同编码策略(如独热编码、嵌入、数值映射)对模型性能的影响。
  • 确定随机效应在高基数场景下是否能作为有效的正则化手段。

提出的方法

  • 在真实世界的表格数据集上,实证比较树提升(LightGBM、CatBoost、GPBoost)、带实体嵌入的深度神经网络以及线性混合效应模型的多种变体。
  • 在树提升和深度神经网络中使用随机效应来建模组间变异,将高基数分类变量的每个水平视为随机效应。
  • 采用混合效应建模方法,其中响应均值被建模为固定效应与随机效应之和,随机效应从具有学习方差的正态分布中抽取。
  • 对于深度神经网络,采用混合架构,结合全连接层与随机效应(LMMNN),以捕捉组间模式。
  • 对于树提升,利用LightGBM和CatBoost对分类变量的原生支持,并与数值编码及随机效应下的性能进行比较。
  • 使用均方误差(MSE)评估模型,并报告相对于最佳方法的平均相对差异,以及在各数据集上的平均排名。
Figure 1: Average relative difference (in %) to the lowest test MSE. The Wages data set is not included for calculating this since not all methods were run on it.
Figure 1: Average relative difference (in %) to the lowest test MSE. The Wages data set is not included for calculating this since not all methods were run on it.

实验结果

研究问题

  • RQ1在机器学习模型中引入随机效应是否能提升高基数分类变量的预测准确率?
  • RQ2在预测性能方面,带随机效应的树提升模型与带随机效应的深度神经网络相比如何?
  • RQ3不同编码策略(如独热编码、嵌入、数值映射)对高基数分类变量的模型性能有何影响?
  • RQ4线性混合效应模型在此设置下是否优于经典独立模型?
  • RQ5在处理高基数分类变量时,树提升模型是否始终优于深度神经网络?

主要发现

  • 引入随机效应的机器学习模型相比其经典版本(无随机效应)显著提升了预测准确率。
  • 带随机效应的树提升模型优于带随机效应的深度神经网络,其相对于最佳方法的平均相对差异为:LMMNN为17.3%,LightGBM(Cat)为17.4%;而LightGBM(Num)为111%,使用嵌入的神经网络为189%。
  • 整体表现最佳的方法是带随机效应的GPBoost,其平均相对差异为9.63%,平均排名为2.43。
  • 线性混合效应模型表现最差,平均相对差异为47.7%,平均排名为5.71。
  • 使用原生分类变量支持的CatBoost和LightGBM优于其数值编码版本,其中LightGBM(Cat)的平均排名为3.29。
  • 运行时间差异显著,神经网络和LMMNN在GPU上运行,其他模型在CPU上运行,但性能差异与运行速度无直接关联。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。