[论文解读] Robust Kernel (Cross-) Covariance Operators in Reproducing Kernel Hilbert Space toward Kernel Methods
本文提出使用广义损失函数替代二次损失的鲁棒核协方差(CO)与交叉协方差(CCO)算子,实现对异常值不敏感的鲁棒核典型相关分析(KCCA)。该方法采用核化迭代加权最小二乘法(KIRWLS),在合成数据与影像遗传学数据上均表现出优于经典方法与当前先进方法的性能,具有更高的鲁棒性与分类准确率。
To the best of our knowledge, there are no general well-founded robust methods for statistical unsupervised learning. Most of the unsupervised methods explicitly or implicitly depend on the kernel covariance operator (kernel CO) or kernel cross-covariance operator (kernel CCO). They are sensitive to contaminated data, even when using bounded positive definite kernels. First, we propose robust kernel covariance operator (robust kernel CO) and robust kernel crosscovariance operator (robust kernel CCO) based on a generalized loss function instead of the quadratic loss function. Second, we propose influence function of classical kernel canonical correlation analysis (classical kernel CCA). Third, using this influence function, we propose a visualization method to detect influential observations from two sets of data. Finally, we propose a method based on robust kernel CO and robust kernel CCO, called robust kernel CCA, which is designed for contaminated data and less sensitive to noise than classical kernel CCA. The principles we describe also apply to many kernel methods which must deal with the issue of kernel CO or kernel CCO. Experiments on synthesized and imaging genetics analysis demonstrate that the proposed visualization and robust kernel CCA can be applied effectively to both ideal data and contaminated data. The robust methods show the superior performance over the state-of-the-art methods.
研究动机与目标
- 为解决在污染数据存在下,无监督核学习中缺乏坚实可靠的鲁棒方法的问题。
- 开发对异常值不敏感的鲁棒核协方差与交叉协方差算子,其鲁棒性优于经典核CO与CCO。
- 推导经典核CCA的影响力函数(IF),以量化其对数据污染的敏感性。
- 提出一种基于影响力函数的可视化方法,用于在两个数据集中检测有影响力的(异常)观测。
- 提出基于鲁棒CO与CCO的鲁棒核典型相关分析,提升在噪声数据与高维数据中的性能。
提出的方法
- 提出使用广义损失函数(如Huber型)替代二次损失的鲁棒核CO与CCO,以降低对异常值的敏感性。
- 推导经典核CCA的影响力函数(IF),量化其对数据污染的敏感性。
- 开发一种可视化技术,利用核CCA的影响力函数检测两个数据集中有影响力的观测。
- 通过结合鲁棒CO与CCO,提出鲁棒核典型相关分析,实现在异常值存在下的鲁棒估计。
- 采用核化迭代加权最小二乘法(KIRWLS)算法,高效计算鲁棒核算子。
- 将该方法应用于真实世界数据,包括影像遗传学与UCI数据集,用于分类与特征提取。
实验结果
研究问题
- RQ1如何使无监督核学习中的核协方差与交叉协方差算子对污染具有鲁棒性?
- RQ2经典核CCA的影响力函数是什么?其如何揭示对异常值的敏感性?
- RQ3基于影响力函数的可视化方法能否有效检测两个数据集中有影响力的观测?
- RQ4与经典核CCA、hsicCCA和ktaCCA相比,鲁棒核CCA在鲁棒性与分类准确率方面表现如何?
- RQ5所提出的鲁棒框架能否推广至依赖CO与CCO的其他核方法?
主要发现
- 在Wine、Breast Tissue、Diabetes与Lymphoma数据集上,鲁棒核CCA的分类误差低于经典核CCA,尤其在低维特征空间中表现更优。
- 在Wine数据集上,经典与鲁棒核CCA均实现2.81%的误差率(使用2个典型变量),但鲁棒CCA在数据污染下保持稳定性。
- 在高维Lymphoma数据集(4026个特征)上,鲁棒核CCA在使用2个典型变量时实现0.00%的误差率,优于hsicCCA与ktaCCA,后两者因维度灾难而失效。
- 影响力函数可视化成功识别出合成数据与真实影像遗传学数据中的有影响力观测,证实了该方法的诊断能力。
- 与hsicCCA和ktaCCA相比,鲁棒核CCA表现更优,后者在高维设置下无法提取全部典型变量,如表3中星号所示。
- KIRWLS算法实现了鲁棒核算子的高效计算,支持可扩展性与实际部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。