Skip to main content
QUICK REVIEW

[论文解读] Efficient Feature Group Sequencing for Anytime Linear Prediction

Hanzhang Hu, Alexander Grubb|arXiv (Cornell University)|Sep 19, 2014
Advanced Bandit Algorithms Research参考文献 24被引用 5
一句话总结

本文提出高效的贪心算法——CS-G-FR 和 CS-G-OMP,用于在具有计算成本的特征分组设置下进行任意时间线性预测。通过将前向回归(Forward Regression)和正交匹配追踪(Orthogonal Matching Pursuit)扩展至基于成本感知评分的分组特征选择,该方法在所有预算水平下均实现近似最优的预测性能,并具备理论保证:成本为 $4B$ 时可近似任意成本 $B$ 的最优性能,且该界为紧致界。

ABSTRACT

We consider extit{anytime} linear prediction in the common machine learning setting, where features are in groups that have costs. We achieve anytime (or interruptible) predictions by sequencing the computation of feature groups and reporting results using the computed features at interruption. We extend Orthogonal Matching Pursuit (OMP) and Forward Regression (FR) to learn the sequencing greedily under this group setting with costs. We theoretically guarantee that our algorithms achieve near-optimal linear predictions at each budget when a feature group is chosen. With a novel analysis of OMP, we improve its theoretical bound to the same strength as that of FR. In addition, we develop a novel algorithm that consumes cost $4B$ to approximate the optimal performance of extit{any} cost $B$, and prove that with cost less than $4B$, such an approximation is impossible. To our knowledge, these are the first anytime bounds at extit{all} budgets. We test our algorithms on two real-world data-sets and evaluate them in terms of anytime linear prediction performance against cost-weighted Group Lasso and alternative greedy algorithms.

研究动机与目标

  • 在特征分组且每组具有相关计算成本的场景下,实现任意时间线性预测。
  • 将类似前向回归(FR)和正交匹配追踪(OMP)的贪心算法扩展至分组-成本设置,同时保持理论性能保证。
  • 提出一种适用于所有预算水平的新型任意时间性能界,而不仅限于选定的分组边界。
  • 证明成本为 $4B$ 时,可充分且必要(在常数因子范围内)近似预算 $B$ 下的最优性能。
  • 在真实世界数据集上,通过实证验证所提方法相较于 Group Lasso 和其他贪心基线的性能。

提出的方法

  • 通过基于单位成本下可解释方差边际增益选择特征组,将前向回归(FR)扩展至分组设置。
  • 通过使用按组成本加权的梯度范数以及马氏距离范数 $\nabla_g^T (X_g^T X_g)^{-1} \nabla_g$,将正交匹配追踪(OMP)适配至分组设置,以考虑组间相关性。
  • 引入分组白化作为预处理步骤,确保 OMP 梯度范数等于标准 $\ell_2$ 范数,从而提升理论与实证性能。
  • 提出一种新型算法框架,按序选择特征组以最小化所有预算下的预测风险,而不仅限于分组边界。
  • 基于子模优化与特征值界进行理论分析,证明 CS-G-FR 与 CS-G-OMP 均能以 $1 - e^{-\lambda^*}$ 的因子实现近似最优可解释方差,与标准 FR 的最佳已知界一致。
  • 证明:任何固定序列均无法在低于 $4B$ 成本下实现对最优 $B$-预算性能的更优近似,从而确立了该界为紧致界。

实验结果

研究问题

  • RQ1贪心特征组选择能否在分组计算成本约束下扩展至任意时间线性预测,同时保持理论性能保证?
  • RQ2在按序选择特征组时,任意时间线性预测的最优成本近似比的紧致界是什么?
  • RQ3分组白化如何影响 OMP 在分组-成本设置下的性能与理论分析?
  • RQ4所提算法在预测精度与及时性方面,相较于成本加权 Group Lasso 及其他贪心基线表现如何?
  • RQ5能否建立一个适用于所有预算水平的统一性能界,而不仅限于分组选择点?

主要发现

  • 所提 CS-G-FR 与 CS-G-OMP 算法在理论保证下实现近似最优可解释方差,其界为 $1 - e^{-\lambda^*}$,与标准 FR 的最佳已知界一致。
  • 提出一种新颖的理论分析,将 OMP 的界改进至与 FR 性能一致,解决了先前对 OMP 在分组设置下理论理解的空白。
  • 论文证明:成本为 $4B$ 时,可充分近似任意成本 $B$ 的最优性能,且该界为紧致界——任何固定序列均无法在低于 $4B$ 成本下实现更优近似。
  • 在农业与 Yahoo! LTR 数据集上的实证结果表明,采用分组白化的 CS-G-OMP 在所有场景下均显著优于基线稀疏方法与单特征变体,尤其在特征组相关性较高的情况下表现更优。
  • CS-G-FR 在所有方法中表现最佳,其次为 CS-G-OMP,其训练时间显著低于 Lasso 路径计算,在 Yahoo! LTR 数据集中实现最高达 20 倍的加速。
  • 性能曲线显示,分组白化能持续提升预测质量,尤其在具有相关特征的数据集中,可有效防止对冗余特征组的高估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。