[论文解读] Binarsity: a penalization for one-hot encoded features in linear supervised learning
本文提出 Binarsity,一种针对线性监督学习中 one-hot 编码连续特征的新型惩罚方法。通过结合组总变差正则化与每组特征的线性约束,Binarsity 能够诱导出分段常数且块稀疏的模型权重,从而实现同时的特征选择与切点检测。该方法在稀疏加法模型下达到最优收敛速率,且计算复杂度与 L1 正则化相当,性能达到当前最先进水平。
This paper deals with the problem of large-scale linear supervised learning in settings where a large number of continuous features are available. We propose to combine the well-known trick of one-hot encoding of continuous features with a new penalization called \emph{binarsity}. In each group of binary features coming from the one-hot encoding of a single raw continuous feature, this penalization uses total-variation regularization together with an extra linear constraint. This induces two interesting properties on the model weights of the one-hot encoded features: they are piecewise constant, and are eventually block sparse. Non-asymptotic oracle inequalities for generalized linear models are proposed. Moreover, under a sparse additive model assumption, we prove that our procedure matches the state-of-the-art in this setting. Numerical experiments illustrate the good performances of our approach on several datasets. It is also noteworthy that our method has a numerical complexity comparable to standard $\ell_1$ penalization.
研究动机与目标
- 通过改进特征编码方式,解决高维线性模型中连续特征的过拟合问题。
- 通过结构化正则化,实现对连续特征的特征选择与最优切点检测的同步进行。
- 开发一种将 one-hot 编码与总变差惩罚相结合的方法,以增强模型的灵活性与可解释性。
- 在稀疏加法假设下,建立广义线性模型的非渐近 oracle 不等式与收敛速率。
提出的方法
- 提出 Binarsity,一种对 one-hot 编码特征应用组总变差正则化的惩罚方法。
- 为每组特征施加额外的线性约束,以消除共线性并强制实现块稀疏性。
- 使用邻近算法高效求解优化问题,其复杂度与 L1 正则化相当。
- 将该惩罚方法应用于广义线性模型,使决策函数在每个特征上呈现分段常数形式。
- 采用一种离散化方案,将每个连续特征划分为若干区间,每个区间被编码为一个二值特征。
- 在稀疏加法模型假设下推导出 oracle 不等式与收敛速率,证明在高维设置下具有最优性。
实验结果
研究问题
- RQ1结构化惩罚是否能提升 one-hot 编码连续特征在线性模型中的泛化性能?
- RQ2将总变差正则化与线性约束结合,是否能比标准 L1 正则化实现更优的特征选择与切点检测?
- RQ3所提出的方法是否能在具有连续特征的稀疏加法模型中实现最优收敛速率?
- RQ4在实际应用中,Binarsity 的计算复杂度与标准 L1 正则化方法相比如何?
- RQ5Binarsity 所诱导的块稀疏结构在真实世界数据集中是否能有效识别相关特征与区间?
主要发现
- 在稀疏加法模型下,Binarsity 达到最优收敛速率,性能与当前最先进方法相当。
- 该方法在每个特征上诱导出分段常数的决策函数,从而实现对线性关系之外的灵活建模。
- 块稀疏结构确保:若某一特征组中所有权重相等,则整个组将被置零,从而实现原始特征的选择。
- 建立了非渐近 oracle 不等式,表明预测风险被一个依赖于真实稀疏性与模型复杂度的项所界定。
- 数值实验表明,该方法在多个数据集上均表现出强劲的实证性能,且计算成本与 L1 正则化相当。
- 该方法实现了预测误差界为 $ \frac{L^2 | abla_*|^2}{D^2} + \frac{\sigma^2 D | abla_*| M_n (A + \log(DpM_n)))}{n} $,其中 $ D = n^{1/3} $,证实了其最优收敛速率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。