Skip to main content
QUICK REVIEW

[论文解读] Consistent Semi-Supervised Graph Regularization for High Dimensional Data

Xiaoyi Mai, Romain Couillet|arXiv (Cornell University)|Jun 13, 2020
Remote-Sensing Image Classification参考文献 22被引用 6
一句话总结

该论文提出了一种基于中心化相似度的图正则化方法,以解决在高维数据中半监督拉普拉斯正则化不一致的问题,其中未标记数据由于距离集中而几乎无法贡献。通过在成对相似度上引入中心化操作,该方法在标准拉普拉斯正则化基础上实现了稳定且一致的性能提升,具有理论保证,并在高斯混合模型下得到实证验证。

ABSTRACT

Semi-supervised Laplacian regularization, a standard graph-based approach for learning from both labelled and unlabelled data, was recently demonstrated to have an insignificant high dimensional learning efficiency with respect to unlabelled data (Mai and Couillet 2018), causing it to be outperformed by its unsupervised counterpart, spectral clustering, given sufficient unlabelled data. Following a detailed discussion on the origin of this inconsistency problem, a novel regularization approach involving centering operation is proposed as solution, supported by both theoretical analysis and empirical results.

研究动机与目标

  • 解决在高维数据中半监督拉普拉斯正则化不一致的问题,其中未标记数据对学习的贡献可忽略。
  • 将高维中距离集中识别为图-based 半监督学习泛化性能差的根本原因。
  • 提出一种新颖的正则化框架,通过中心化相似度矩阵恢复未标记数据的实用性。
  • 在高维渐近框架下,理论证明所提方法相对于标准拉普拉斯正则化的稳定性和优越性。
  • 证明该方法在各向同性高斯模型下可逼近最优分类准确率,即使标记数据有限。

提出的方法

  • 提出一种使用中心化相似度的新图正则化方法:$ \tilde{W}_{ij} = h(\|x_i - x_j\|^2 / p) - \mu_h $,其中 $ \mu_h $ 为相似度的均值。
  • 对相似度矩阵 $ W $ 执行中心化操作,得到 $ \hat{W} = P_n W P_n $,其中 $ P_n = I_n - \frac{1}{n} \mathbf{1}_n \mathbf{1}_n^T $,以消除全局偏差。
  • 利用随机矩阵理论推导 $ \hat{W} $ 的渐近矩阵等价形式,表明其收敛至包含类别均值与偏差的结构化形式。
  • 建立新方法与标签传播之间的理论联系,将其框架化为在中心化相似度图上的扩散过程。
  • 在高维高斯混合模型下分析渐近分类准确率,推导性能预测的不动点方程。
  • 证明方法的一致性:分类误差在相同数据条件下收敛至低于标准拉普拉斯正则化的下界,且保证性能增益。

实验结果

研究问题

  • RQ1为何标准半监督拉普拉斯正则化在高维设置下无法有效利用未标记数据?
  • RQ2高维中距离集中如何破坏图-based 半监督学习的几何假设?
  • RQ3对相似度矩阵进行中心化操作是否能恢复高维半监督学习中未标记数据的学习效率?
  • RQ4与高维各向同性高斯模型下的最优可实现准确率相比,所提中心化正则化方法的理论性能极限是什么?
  • RQ5所提方法在不同标记数据与未标记数据比例下,是否始终相对于标准拉普拉斯正则化表现出一致的性能增益?

主要发现

  • 所提中心化正则化方法在各向同性高维高斯模型中,其分类准确率渐近逼近最优性能极限。
  • 该方法保证相对于标准拉普拉斯正则化具有性能增益,且在相同数据条件下,渐近误差收敛至严格更低的值。
  • 中心化方法分类准确率的不动点方程 $ q_c = \|\mu\|^2 - \frac{p\|\mu\|^2}{p + \|\mu\|^2} \left( n[l] + \frac{q_c}{q_c + 1} n[u] \right) $ 表明,当 $ n[u] > 0 $ 时,未标记数据具有实质性贡献,这与标准拉普拉斯正则化中未标记数据无贡献的情况形成对比。
  • 为匹配最优性能所需的有效未标记样本比例,被减少为 $ g(q^*) = \mathbb{E}_{z \sim \mathcal{N}(q^*, q^*)}[\tanh(z)] \cdot \frac{q^* + 1}{q^*} $ 的因子,该因子最大可达 1.168,表明数据效率显著提升。
  • 即使标记与未标记样本数量相等,中心化方法在超参数 $ \varepsilon $ 被最优调优时,性能也极为接近最优,尤其在该条件下。
  • 理论分析证实该新方法具有一致性:$ \frac{1}{n_k} (\mathbf{j}_k^T \mathbf{v}_{\text{ctr}})^2 = \frac{1}{n_k} (\mathbf{j}_k^T \mathbf{v}_{\text{Lap}})^2 + o_P(1) $,证明在中心化图上进行标签传播可渐近等价于最优分类器的结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。