[论文解读] MISSION: Ultra Large-Scale Feature Selection using Count-Sketches
MISSION 是一种内存高效的特征选择框架,利用 Count-Sketch 数据结构在拥有数十亿个特征的超大规模数据集上实现随机梯度下降,仅使用 O(log²p) 的工作内存,同时保持特征的可解释性。它在真实世界数据集(如 DNA 元基因组学和点击率预测)上实现了最先进水平的准确率,优于贪心阈值法,且在不牺牲可解释性的情况下匹配了特征哈希的性能。
Feature selection is an important challenge in machine learning. It plays a crucial role in the explainability of machine-driven decisions that are rapidly permeating throughout modern society. Unfortunately, the explosion in the size and dimensionality of real-world datasets poses a severe challenge to standard feature selection algorithms. Today, it is not uncommon for datasets to have billions of dimensions. At such scale, even storing the feature vector is impossible, causing most existing feature selection methods to fail. Workarounds like feature hashing, a standard approach to large-scale machine learning, helps with the computational feasibility, but at the cost of losing the interpretability of features. In this paper, we present MISSION, a novel framework for ultra large-scale feature selection that performs stochastic gradient descent while maintaining an efficient representation of the features in memory using a Count-Sketch data structure. MISSION retains the simplicity of feature hashing without sacrificing the interpretability of the features while using only O(log^2(p)) working memory. We demonstrate that MISSION accurately and efficiently performs feature selection on real-world, large-scale datasets with billions of dimensions.
研究动机与目标
- 解决在标准方法因内存和计算限制而失效的超高维数据集中的特征选择挑战。
- 在大规模学习中保持特征可解释性,同时避免显式特征表示带来的内存开销。
- 通过稀疏、近似的表示实现高效、可扩展的特征选择,支持迭代优化。
- 在真实世界、百亿维数据集上,以更高的准确率和更快的收敛速度超越现有的贪心阈值法和特征哈希方法。
- 支持在科学应用(如 DNA 元基因组学)中发现有意义的特征,其中交互特征至关重要。
提出的方法
- MISSION 使用 Count-Sketch 数据结构,在 O(log²p) 内存内维护完整特征向量的近似、紧凑表示,从而实现无需显式存储所有特征的高效访问。
- 它采用带硬阈值的随机梯度下降(SGD),在每一步仅更新前 k 个特征,同时利用 Count-Sketch 近似追踪特征权重。
- 该框架使用堆数据结构维护前 k 个特征,支持可选的延迟更新,以在权重变化较小时减少昂贵的堆操作。
- MISSION 利用了真实世界数据的稀疏性——即特征向量极为稀疏——从而在优化过程中避免使用密集的内存表示。
- 它支持无需完整词典或显式特征索引的特征选择,与传统哈希或显式正则化方法不同。
- 该方法设计为可扩展且可并行化,具备高效的堆更新和通过随机化映射实现的近似特征追踪。
实验结果
研究问题
- RQ1一个特征选择框架是否能在 p > 10^12 个特征的数据集上高效运行的同时保持可解释性?
- RQ2当存储完整特征向量不可行时,如何在 O(log²p) 内存下实现特征选择?
- RQ3在超大规模设置下,使用 Count-Sketch 数据结构是否能比 IHT 等贪心阈值法实现更好的收敛性和准确率?
- RQ4该框架是否能在保持特征身份和可解释性的前提下,超越特征哈希的准确率?
- RQ5在内存受限条件下,该方法在不同真实世界数据集(包括 DNA 元基因组学和点击率预测)上的可扩展性如何?
主要发现
- 在 Criteo 数据集上,MISSION 的平均精度(AP)达到 0.510,比 Batch IHT 和 SGD IHT 的 0.498 高出 2.3%。
- 在 DNA 元基因组学数据集上,MISSION 的收敛速度优于 IHT,且在 5 个周期后达到与完整特征哈希基线相当的性能。
- MISSION 在收敛速度上比 IHT 快 1–4 个周期,表明尽管前 k 个更新次数较少,仍实现了高效的优化。
- MISSION 仅使用 O(log²p) 内存,使其能够扩展至高达 2^48 个特征的数据集(例如,DNA 序列中的 16^12 个 k-mer),而标准表示方式将需要拍字节级别的存储。
- MISSION 在实际运行时间上比特征哈希慢 15%(17.5 小时 vs. 15 小时),但由于收敛更快、准确率更高,整体效果更优。
- 即使在内存受限(额外仅 786,432 个元素)的情况下,该框架仍保持高准确率,表明其在超大规模设置下的鲁棒性与高效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。