Skip to main content
QUICK REVIEW

[论文解读] Distributed Learning with Random Features.

Jian Li, Yong Liu|arXiv (Cornell University)|Jun 7, 2019
Sparse and Compressive Sensing Techniques参考文献 37被引用 6
一句话总结

该论文提出了一种使用随机特征的分布式核岭回归框架,以在降低计算成本的同时实现最优泛化。在标准假设下,该方法在使用 𝒪(√N) 个数据分区和 𝒪(√N) 个随机特征时,可达到 𝒪(1/N) 的学习速率,保持最优精度的同时在大规模非参数学习中实现高效扩展。

ABSTRACT

Distributed learning and random projections are the most common techniques in large scale nonparametric statistical learning. In this paper, we study the generalization properties of kernel ridge regression using both distributed methods and random features. Theoretical analysis shows the combination remarkably reduces computational cost while preserving the optimal generalization accuracy under standard assumptions. In a benign case, $\mathcal{O}(\sqrt{N})$ partitions and $\mathcal{O}(\sqrt{N})$ random features are sufficient to achieve $\mathcal{O}(1/N)$ learning rate, where $N$ is the labeled sample size. Further, we derive more refined results by using additional unlabeled data to enlarge the number of partitions and by generating features in a data-dependent way to reduce the number of random features.

研究动机与目标

  • 分析增强随机特征的分布式核岭回归的泛化性能。
  • 在保持最优泛化精度的同时,降低大规模非参数学习中的计算成本。
  • 研究未标记数据和数据相关特征生成方式如何提升效率并减少特征需求。
  • 建立实现最优收敛所需的分区数和随机特征数的理论边界。

提出的方法

  • 该方法结合了分布式学习(数据被划分到多个机器上)与随机特征近似,以降低核计算成本。
  • 通过使用随机特征近似核矩阵,实现在不牺牲泛化性能的前提下实现可扩展计算。
  • 理论分析在标准假设下推导了泛化误差边界,表明 𝒪(√N) 个分区和 𝒪(√N) 个随机特征足以实现 𝒪(1/N) 的学习速率。
  • 额外策略包括利用未标记数据增加分区数量,以及以数据相关方式生成特征,以减少所需随机特征的数量。
  • 该框架通过在理论保证下平衡分区与特征近似,保持了最优泛化精度。

实验结果

研究问题

  • RQ1在分布式核岭回归中,实现最优泛化的最少分区数和随机特征数是多少?
  • RQ2引入未标记数据如何影响使用随机特征的分布式学习的可扩展性和效率?
  • RQ3数据相关特征生成是否能减少所需随机特征的数量,同时保持泛化精度?
  • RQ4在此分布式框架中,控制计算成本与学习速率之间权衡的理论边界是什么?

主要发现

  • 在使用 𝒪(√N) 个分区和 𝒪(√N) 个随机特征时,该方法实现了 𝒪(1/N) 的学习速率,与标准假设下的最优速率一致。
  • 分布式学习与随机特征的结合在显著降低计算成本的同时,保持了最优泛化精度。
  • 利用未标记数据可增加分区数量,从而在不降低性能的前提下提升可扩展性。
  • 数据相关特征生成减少了所需随机特征的数量,从而提高了学习过程的效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。