[论文解读] On Column Selection in Approximate Kernel Canonical Correlation Analysis
本文提出了一种基于Nyström逼近的非均匀列选择策略,用于近似核典型相关分析(KCCA),利用岭杠杆度量(ridge leverage scores)以提高逼近精度。该方法建立了训练误差和样本外核稳定性理论边界,并提出一种增量算法,可高效实现跨不同秩的模型选择,在真实世界和合成数据集上均优于均匀采样。
We study the problem of column selection in large-scale kernel canonical correlation analysis (KCCA) using the Nyström approximation, where one approximates two positive semi-definite kernel matrices using "landmark" points from the training set. When building low-rank kernel approximations in KCCA, previous work mostly samples the landmarks uniformly at random from the training set. We propose novel strategies for sampling the landmarks non-uniformly based on a version of statistical leverage scores recently developed for kernel ridge regression. We study the approximation accuracy of the proposed non-uniform sampling strategy, develop an incremental algorithm that explores the path of approximation ranks and facilitates efficient model selection, and derive the kernel stability of out-of-sample mapping for our method. Experimental results on both synthetic and real-world datasets demonstrate the promise of our method.
研究动机与目标
- 通过用数据相关的非均匀采样策略替代均匀地标采样,提升大规模核典型相关分析(KCCA)的逼近精度。
- 基于核岭回归中导出的岭杠杆度量,开发一种理论基础坚实的列选择方法,用于基于Nyström的KCCA。
- 为训练逼近误差(典型相关误差)和样本外映射稳定性提供理论保证。
- 设计一种增量算法,高效计算多个逼近秩下的解,以实现快速模型选择。
- 通过实证验证,非均匀采样在相关性精度和收敛速度方面优于均匀采样。
提出的方法
- 使用Nyström方法通过从训练集中选取地标点,对两个中心化核矩阵 $\overline{\mathbf{K}}_1$ 和 $\overline{\mathbf{K}}_2$ 进行逼近。
- 提出一种基于岭杠杆度量的非均匀采样策略,该度量为每个视图单独计算,并用于加权地标点的选择概率。
- 通过将误差分解为各视图的贡献,并利用核矩阵差的谱范数,推导出典型相关逼近误差的上界。
- 引入一种增量算法,重用先前的低秩逼近,以高效计算更高秩下的解,从而实现快速模型选择。
- 通过将Nyström逼近误差与映射差异关联,建立样本外映射的核稳定性边界。
- 在KCCA公式中,通过矩阵 $\mathbf{H} = \mathbf{I} - \frac{1}{N}\mathbf{1}\mathbf{1}^T$ 的中心化变换处理中心化核矩阵。
实验结果
研究问题
- RQ1基于岭杠杆度量的非均匀采样是否能相比均匀采样提升核典型相关分析的逼近精度?
- RQ2在典型相关逼近误差和样本外映射稳定性方面,可建立哪些理论保证?
- RQ3如何设计一种高效的增量算法,以在不从头计算的情况下,跨多个逼近秩计算解?
- RQ4两视图之间的相互作用如何影响KCCA中地标选择的性能?是否可被采样策略所利用?
- RQ5与均匀采样和基线KCCA相比,所提方法在真实世界和合成数据集上是否实现了更优的相关性表现?
主要发现
- 基于岭杠杆度量的非均匀采样策略在合成数据集和真实世界数据集(包括JW11数据集)上,均实现了比均匀采样更高的典型相关性精度。
- 在JW11数据集上,该方法在秩5000时达到101.5的相关性,优于均匀采样(100.8)和基于岭的均匀采样(98.4)。
- 理论分析表明,典型相关逼近误差的上界由全矩阵与逼近矩阵之间差的谱范数决定,且明确依赖于杠杆度量分布。
- 增量算法可高效计算多个秩下的解,相比每次从头计算,显著降低了计算成本。
- 推导出样本外映射的核稳定性边界,表明该方法在训练集之外仍能保持可靠的泛化性能。
- 实证结果表明,尽管岭杠杆度量能提升性能,但增益较为有限,原因在于大规模数据集下精确计算杠杆度量的挑战,以及KCCA中两视图间复杂交互作用的影响。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。