Skip to main content
QUICK REVIEW

[论文解读] Dimensionality Reduction for Tukey Regression

Kenneth L. Clarkson, Ruosong Wang|arXiv (Cornell University)|May 14, 2019
Face and Expression Recognition参考文献 29被引用 4
一句话总结

本论文首次提出了针对过约束Tukey回归的降维方法,通过行采样和无偏随机化投影(oblivious sketching)将大规模问题缩减为更小的加权实例。该方法在$\widetilde{O}(\operatorname{nnz}(A) + \operatorname{poly}(d\log n/\varepsilon))$时间内实现$(1+\varepsilon)$-近似解,具有可证明的保证,并在合成数据和真实数据集上得到实证验证。

ABSTRACT

We give the first dimensionality reduction methods for the overconstrained Tukey regression problem. The Tukey loss function $\|y\|_M = \sum_i M(y_i)$ has $M(y_i) \approx |y_i|^p$ for residual errors $y_i$ smaller than a prescribed threshold $τ$, but $M(y_i)$ becomes constant for errors $|y_i| > τ$. Our results depend on a new structural result, proven constructively, showing that for any $d$-dimensional subspace $L \subset \mathbb{R}^n$, there is a fixed bounded-size subset of coordinates containing, for every $y \in L$, all the large coordinates, with respect to the Tukey loss function, of $y$. Our methods reduce a given Tukey regression problem to a smaller weighted version, whose solution is a provably good approximate solution to the original problem. Our reductions are fast, simple and easy to implement, and we give empirical results demonstrating their practicality, using existing heuristic solvers for the small versions. We also give exponential-time algorithms giving provably good solutions, and hardness results suggesting that a significant speedup in the worst case is unlikely.

研究动机与目标

  • 解决Tukey回归缺乏高效降维技术的问题,Tukey回归是一种使用非凸有界损失函数的鲁棒回归变体。
  • 开发实用且可证明准确的方法,将大规模Tukey回归问题缩减为更小、可处理的实例。
  • 为行采样和无偏随机化投影两种方法提供理论保证,分别确保$(1+\varepsilon)$-近似和$O(\log n)$-近似。
  • 通过在合成数据和真实数据集上的实证评估,证明方法的实用性,包括在异常值存在下的鲁棒性能。

提出的方法

  • 提出一种行采样算法,基于Tukey损失下的残差杠杆值,选择加权行子集,确保获得$(1+\varepsilon)$-近似解。
  • 提出一个结构定理,表明对于任意$d$维子空间,一个有界大小的坐标集合可捕获所有在Tukey损失下较大的残差,从而实现高效采样。
  • 使用一个具有$\operatorname{poly}(d\log n)$行的无偏随机化投影矩阵$S$,其计算时间复杂度为$O(\operatorname{nnz}(A))$,可产生$O\left(\log n\right)$-近似解。
  • 通过修改现有的IRLS求解器以处理加权Tukey回归,从而在缩减后的实例上实现实际部署。
  • 设计运行时间在$\widetilde{O}(\operatorname{nnz}(A) + \operatorname{poly}(d\log n/\varepsilon))$内的算法,且采样后问题中非零权重的数量为$\operatorname{poly}(d\log n/\varepsilon)$。
  • 确保随机化投影矩阵$S$与$A$和$b$无关,支持单遍处理,适用于流式计算和分布式环境。

实验结果

研究问题

  • RQ1能否有效将降维技术应用于使用非凸有界损失函数的Tukey回归问题?
  • RQ2Tukey损失的何种结构特性使得能够识别出一个大小固定的小集合坐标,以捕获任意$d$维子空间中所有大残差?
  • RQ3是否可以同时使用行采样和无偏随机化投影,将Tukey回归缩减为更小问题,并保证可证明的近似性能?
  • RQ4所提出的方法在真实世界和合成数据集上的实际表现如何,特别是在存在异常值的情况下?
  • RQ5是否可能仅使用$O(d)$行实现Tukey回归的高效近似最优解?在近似质量与计算效率之间存在何种权衡?

主要发现

  • 行采样算法在$\widetilde{O}(\operatorname{nnz}(A) + \operatorname{poly}(d\log n/\varepsilon))$时间内实现对原始Tukey回归问题的$(1+\varepsilon)$-近似解。
  • 无偏随机化投影方法在使用$\operatorname{poly}(d\log n)$行且$O(\operatorname{nnz}(A))$计算时间下,产生$O(\log n)$-近似解,且与输入数据无关。
  • 实证结果表明,行采样方法将问题规模缩减至$3d$行,且在大多数数据集上保持的近似比不超过2。
  • 行采样方法在近似质量上始终优于无偏随机化投影,尤其在较大投影尺寸下优势更明显,尽管后者速度更快,更适合流式处理。
  • 所提方法在真实数据集(如Facebook评论量、家用电器能耗预测、CT切片定位)上表现实用且高效,即使$b$中$5\%$的条目被异常值污染仍保持鲁棒性。
  • 困难性结果表明,Tukey回归的显著最坏情况加速可能难以实现,暗示所提近似保证具有最优性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。