[论文解读] Sufficient Representations for Categorical Variables
本文在充分潜状态假设下,提出对高基数分类变量使用低维、信息保留的表示方法,使通用一致的估计器能够建模组效应,同时避免独热编码的低效性。结果表明,低秩和稀疏低秩编码等方法在类别数量增加时,优于传统方法。
Many learning algorithms require categorical data to be transformed into real vectors before it can be used as input. Often, categorical variables are encoded as one-hot (or dummy) vectors. However, this mode of representation can be wasteful since it adds many low-signal regressors, especially when the number of unique categories is large. In this paper, we investigate simple alternative solutions for universally consistent estimators that rely on lower-dimensional real-valued representations of categorical variables that are "sufficient" in the sense that no predictive information is lost. We then compare preexisting and proposed methods on simulated and observational datasets.
研究动机与目标
- 解决回归与机器学习中高基数分类变量使用独热编码的低效问题。
- 构建一个学习分类变量低维实值表示的框架,同时保留所有预测信息。
- 使通用一致的估计器能够利用这些表示,而不会损失信号或增加模型复杂度。
- 在模拟数据和真实数据集上评估所提出编码方法的性能,尤其关注类别数量庞大的场景。
- 支持因果推断中的应用,特别是双重稳健处理效应估计,其中高基数分类变量较为常见。
提出的方法
- 引入充分潜状态假设:组别成员 G_i 仅通过未观测的潜变量 L_i 影响结果 Y_i,而非直接作用。
- 定义表示映射 ψ: G → ℝ^k,使得 μ(x,g) = f(x, ψ(g)),确保不损失预测信息。
- 提出编码方法,包括均值法、多项式对数回归(MNL)、低秩和稀疏低秩分解,以学习 ψ。
- 使用交叉验证(K折)选择低秩和稀疏低秩方法的最优维度 k,以最小化过拟合。
- 将学习到的 ψ 应用于将分类变量转换为紧凑的实值向量,以供标准回归模型使用。
- 将这些表示集成到随机森林和 XGBoost 等下游模型中,进行实证评估。
实验结果
研究问题
- RQ1我们能否学习到高基数分类变量的低维实值表示,同时保留全部预测信息?
- RQ2不同编码方法(如均值法、MNL、低秩)与独热编码相比,在预测准确性和鲁棒性方面表现如何?
- RQ3随着类别数量的增加,这些表示的性能是否提升,尤其是在传统方法变得低效时?
- RQ4在具有复杂高基数分类特征的真实数据集中,这些表示在多大程度上提升了模型性能?
- RQ5这些表示能否在因果推断流程中有效应用,例如双重稳健处理效应估计?
主要发现
- 在回归森林中,低秩和稀疏低秩编码方法在所有数据集中持续优于独热编码及其他基线方法,尤其在类别数量较多时表现更优。
- 在巴基斯坦住房数据集中,低秩编码使均方误差(MSE)相比独热编码降低了 17.4%(MSE:8.228 vs. 9.963)。
- 在 XGBoost 中,低秩和稀疏低秩方法与独热编码相比,性能无显著下降,p 值显示差异不显著。
- 在 Ames 住房数据集中,由于协变量数量(p=80)远多于组别数量(|G|=25),其他编码方法的收益微乎其微,表明特征空间大小可能限制性能提升。
- 低秩方法在各数据集中表现最稳健,可能归因于其能有效捕捉低秩结构,并通过交叉验证选择较小的 k 值来减少噪声。
- 充分潜状态假设使信息保留的表示得以构建,验证了所提编码技术的理论基础。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。