Skip to main content
QUICK REVIEW

[论文解读] Tensor machines for learning target-specific polynomial features

Jiyan Yang, Alex Gittens|arXiv (Cornell University)|Apr 7, 2015
Tensor decomposition and applications参考文献 19被引用 7
一句话总结

该论文提出张量机器(TMs),一种通过优化核诱导多项式低秩张量分解来学习目标特定多项式特征的新型方法。与随机特征映射不同,TMs 自适应地选择少量信息丰富的特征,在真实数据集上实现了显著更少的参数量和更快的训练速度,同时保持了更高的准确性。

ABSTRACT

Recent years have demonstrated that using random feature maps can significantly decrease the training and testing times of kernel-based algorithms without significantly lowering their accuracy. Regrettably, because random features are target-agnostic, typically thousands of such features are necessary to achieve acceptable accuracies. In this work, we consider the problem of learning a small number of explicit polynomial features. Our approach, named Tensor Machines, finds a parsimonious set of features by optimizing over the hypothesis class introduced by Kar and Karnick for random feature maps in a target-specific manner. Exploiting a natural connection between polynomials and tensors, we provide bounds on the generalization error of Tensor Machines. Empirically, Tensor Machines behave favorably on several real-world datasets compared to other state-of-the-art techniques for learning polynomial features, and deliver significantly more parsimonious models.

研究动机与目标

  • 解决目标无关的随机特征映射效率低下问题,后者通常需要数千个特征才能达到可接受的准确率。
  • 开发一种方法,学习一组小而明确的、针对目标函数量身定制的多项式特征。
  • 基于低秩张量分解构建假设类,以高效表示多项式核。
  • 与现有的随机特征和核方法相比,实现更好的泛化性能和计算效率。

提出的方法

  • 利用多项式与张量之间的联系,将多项式特征建模为低秩张量分解。
  • 在 Kar 和 Karnick 的随机特征框架基础上,构建受限制的假设类,但以目标特定的方式进行优化。
  • 使用正则化优化方法,学习对应于目标多项式的隐藏张量的低秩近似。
  • 实现两种求解器:TM-Batch(批量优化)和 TM-SFO(随机一阶优化),以支持可扩展训练。
  • 将学习目标表述为在低秩张量分解上最小化正则化经验风险。
  • 通过每轮迭代的 O(ndq²r_TM) 时间复杂度,确保计算效率,其中 q 为张量机器的阶数,r_TM 为近似秩。

实验结果

研究问题

  • RQ1目标特定的特征选择方法是否能在模型简洁性和准确率方面优于目标无关的随机特征映射?
  • RQ2在低秩张量假设类上进行优化,是否能相比随机特征映射获得更优的泛化误差界?
  • RQ3秩参数 r 如何影响张量机器的测试误差和收敛性?
  • RQ4通过随机优化,张量机器是否能高效扩展至大规模、内存外的数据集?
  • RQ5与 CRAFTMaps 和核岭回归等先进方法相比,张量机器在时间-准确率权衡上表现如何?

主要发现

  • 张量机器在每个数据集上最多仅需 72d 个参数,远少于 CRAFTMaps 的 400d 或更多,同时实现了更低的误差。
  • 在所有数据集上,TM 求解器每度数所需的秩一特征数均少于 r=5,展现出极高的模型简洁性。
  • 在 Census 数据集上(q=2),当 r≥3 时测试误差趋于平稳,表明超过中等秩后收益递减。
  • 在 Slice 数据集上(q=5),TMs 的误差比 KRR 降低了近两倍,且 TM-SFO 展现出出色的可扩展性。
  • TM-SFO 的训练时间随数据集规模近似线性增长,而 CRAFTMaps 的训练时间呈超线性增长。
  • TM-SFO 的测试误差在训练样本达 500,000 个时仍持续下降,而 CRAFTMaps 的误差早期即趋于饱和,体现出其自适应优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。