Skip to main content
QUICK REVIEW

[论文解读] Scalable Matrix-valued Kernel Learning for High-dimensional Nonlinear Multivariate Regression and Granger Causality

Vikas Sindhwani, Hà Quang Minh|arXiv (Cornell University)|Oct 17, 2012
Sparse and Compressive Sensing Techniques参考文献 38被引用 11
一句话总结

本文提出了一种可扩展的、无需特征分解的矩阵值核学习框架,用于高维非线性多变量回归与格兰杰因果推断,通过不精确求解器联合优化输入和输出核组件。主要贡献是一种通用的多核学习方法,能够在时间序列中实现稀疏且可解释的因果推断,通过改进的预测性能以及在基因表达数据中获得的生物上合理的因果图得到验证。

ABSTRACT

We propose a general matrix-valued multiple kernel learning framework for high-dimensional nonlinear multivariate regression problems. This framework allows a broad class of mixed norm regularizers, including those that induce sparsity, to be imposed on a dictionary of vector-valued Reproducing Kernel Hilbert Spaces. We develop a highly scalable and eigendecomposition-free algorithm that orchestrates two inexact solvers for simultaneously learning both the input and output components of separable matrix-valued kernels. As a key application enabled by our framework, we show how high-dimensional causal inference tasks can be naturally cast as sparse function estimation problems, leading to novel nonlinear extensions of a class of Graphical Granger Causality techniques. Our algorithmic developments and extensive empirical studies are complemented by theoretical analyses in terms of Rademacher generalization bounds.

研究动机与目标

  • 为解决高维多变量回归中向量值核方法的计算不可行性,提出可扩展的矩阵值核学习方法。
  • 开发一种支持字典中向量值再生核Hilbert空间(RKHS)混合范数正则化结构稀疏性的框架。
  • 通过将因果推断建模为高维时间序列中的稀疏函数估计问题,实现非线性格兰杰因果推断。
  • 通过Rademacher复杂度界为所提出的向量值假设集提供理论保证。
  • 通过从时间进程微阵列数据中揭示生物上合理的基因调控网络,展示该框架在计算生物学中的实用性。

提出的方法

  • 提出一种通用的矩阵值多核学习框架,利用向量值RKHS字典与混合范数正则化,实现稀疏性与结构化学习。
  • 聚焦于由标量输入核与正定输出矩阵组成的可分矩阵值核,实现通用逼近与可扩展性。
  • 开发一种可扩展算法,协调使用两种不精确求解器——共轭梯度法求解线性系统,以及快速稀疏半定规划求解器——以联合优化输入与输出核组件。
  • 采用具有收敛性保证的块坐标下降策略求解内层子问题,避免昂贵的特征分解。
  • 提出一种新公式:核权重中的稀疏性对应时间序列中的因果关系,从而实现非线性图模型格兰杰因果推断。
  • 推导出假设空间的Rademacher复杂度界,将泛化理论扩展至向量值多核学习。

实验结果

研究问题

  • RQ1能否开发一种可扩展且通用的框架,用于基于矩阵值核的高维非线性多变量回归?
  • RQ2如何在无需特征分解的情况下高效实现输入与输出核组件的联合优化?
  • RQ3在核组合中引入结构化稀疏性,能否在非线性场景下实现时间序列中可解释的因果推断?
  • RQ4对于具有混合范数正则化的向量值多核学习,可以建立怎样的理论泛化界?
  • RQ5该框架能否在高维时间序列组学数据中揭示生物上合理的因果关系?

主要发现

  • 所提出的算法在时间序列数据上实现了优越的预测性能,包含输入与输出核学习的非线性模型在35个功能基因组群中均取得了最低的保留RMSE。
  • 非线性模型成功识别出解旋酶活性在果蝇基因网络中作为核心因果驱动因子,而线性模型未能捕捉到这一关系。
  • 线性模型错误地推断出脂质结合与膜相关功能之间的因果联系,而该非线性模型正确地将这些功能与未折叠蛋白结合及ATP酶活性关联起来。
  • 输出核矩阵估计揭示了组内生物上合理的依赖关系,例如分子伴侣、ATP酶活性与未折叠蛋白结合之间的关联。
  • 通过不精确求解器实现可扩展性,避免了先前工作中计算成本高昂的特征分解。
  • 推导出Rademacher复杂度界,为所提出的向量值多核学习设置提供了泛化能力的理论依据。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。