Skip to main content
QUICK REVIEW

[论文解读] Naive Feature Selection: a Nearly Tight Convex Relaxation for Sparse Naive Bayes

Armin Askari, Alexandre d’Aspremont|arXiv (Cornell University)|May 23, 2019
Rough Sets and Fuzzy Logic被引用 4
一句话总结

本文提出了一种朴素贝叶斯的稀疏变体,通过凸松弛直接在分类系数中施加稀疏性,实现特征选择的精确或近乎紧致的解。该方法在统计性能上达到与LASSO和递归特征消除相当的水平,但计算复杂度接近线性,使用非优化的CPU实现,在160万条样本、1200万特征的文本数据集上训练时间不足15秒。

ABSTRACT

Due to its linear complexity, naive Bayes classification remains an attractive supervised learning method, especially in very large-scale settings. We propose a sparse version of naive Bayes, which can be used for feature selection. This leads to a combinatorial maximum-likelihood problem, for which we provide an exact solution in the case of binary data, or a bound in the multinomial case. We prove that our convex relaxation bounds becomes tight as the marginal contribution of additional features decreases, using a priori duality gap bounds dervied from the Shapley-Folkman theorem. We show how to produce primal solutions satisfying these bounds. Both binary and multinomial sparse models are solvable in time almost linear in problem size, representing a very small extra relative cost compared to the classical naive Bayes. Numerical experiments on text data show that the naive Bayes feature selection method is as statistically effective as state-of-the-art feature selection methods such as recursive feature elimination, $l_1$-penalized logistic regression and LASSO, while being orders of magnitude faster.

研究动机与目标

  • 开发一种稀疏朴素贝叶斯模型,可直接控制特征选择的基数,而无需超参数调优。
  • 为二值(伯努利)数据提供精确解,为多项式数据提供紧致的凸松弛。
  • 实现训练复杂度接近线性于数据规模,保持经典朴素贝叶斯的可扩展性。
  • 证明该方法在统计性能上与最先进特征选择技术相当或更优,同时快几个数量级。
  • 表明当特征的边际贡献减小时,该松弛变得越来越紧。

提出的方法

  • 将具有显式基数约束的分类系数向量的组合最大似然问题形式化。
  • 利用对偶性和KKT条件,为二值(伯努利)数据推导出精确解,简化为对特征系数的阈值化操作。
  • 针对多项式数据,提出一种基于拉格朗日对偶方法的凸松弛,得到最优目标的上界。
  • 采用两阶段算法:首先通过标准朴素贝叶斯计算特征系数,然后应用阈值规则以实现稀疏性。
  • 利用对偶方法证明,当特征的边际贡献较小时,该松弛是紧致的。
  • 利用朴素贝叶斯分类器的结构,确保最终模型保持可解释性且计算高效。

实验结果

研究问题

  • RQ1能否为稀疏朴素贝叶斯推导出一种既计算高效又统计紧致的凸松弛?
  • RQ2所提出的方法是否能在不依赖稀疏度水平超参数调优的情况下实现精确的稀疏控制?
  • RQ3在准确率和速度方面,稀疏朴素贝叶斯模型与LASSO、递归特征消除及其他特征选择基线相比表现如何?
  • RQ4在何种条件下,凸松弛变得紧致,特别是与特征边际贡献的关系如何?
  • RQ5该方法能否在超大规模数据集(如数百万特征和训练样本)上保持近乎线性的训练时间?

主要发现

  • 所提出的稀疏朴素贝叶斯模型在文本分类任务中,统计性能与LASSO和递归特征消除等最先进方法相当。
  • 对于包含160万条训练样本和约1200万特征的大规模数据集,使用非优化CPU实现,该模型训练时间不足15秒。
  • 该方法为二值(伯努利)数据提供精确解,为多项式数据提供随特征边际贡献减小而愈发紧致的凸松弛。
  • 该模型在准确率和效率方面均优于简单的基线方法,如阈值化朴素贝叶斯和似然比特征选择。
  • 该算法的复杂度几乎与特征数和样本数呈线性关系,与经典朴素贝叶斯的复杂度相当,仅增加极少开销。
  • 该方法消除了为达到期望稀疏度而进行超参数调优的需求,因为稀疏度通过基数约束直接控制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。