[论文解读] Calibrating and Improving Graph Contrastive Learning
本文提出 Contrast-Reg,一种即插即用的正则化方法,通过将对比损失最小化与下游任务性能对齐,提升图对比学习的效果。通过将期望校准误差(ECE)适配用于衡量对比对中预测与真实标签之间的差异,Contrast-Reg 确保损失降低的同时能提升下游准确率,显著增强在多种 GNN 主干网络和对比学习框架下的泛化能力,在基准数据集上实现 2%–5% 的一致性能提升。
Graph contrastive learning algorithms have demonstrated remarkable success in various applications such as node classification, link prediction, and graph clustering. However, in unsupervised graph contrastive learning, some contrastive pairs may contradict the truths in downstream tasks and thus the decrease of losses on these pairs undesirably harms the performance in the downstream tasks. To assess the discrepancy between the prediction and the ground-truth in the downstream tasks for these contrastive pairs, we adapt the expected calibration error (ECE) to graph contrastive learning. The analysis of ECE motivates us to propose a novel regularization method, Contrast-Reg, to ensure that decreasing the contrastive loss leads to better performance in the downstream tasks. As a plug-in regularizer, Contrast-Reg effectively improves the performance of existing graph contrastive learning algorithms. We provide both theoretical and empirical results to demonstrate the effectiveness of Contrast-Reg in enhancing the generalizability of the Graph Neural Network(GNN) model and improving the performance of graph contrastive algorithms with different similarity definitions and encoder backbones across various downstream tasks.
研究动机与目标
- 识别无监督图对比学习中性能下降的根本原因,即最小化对比损失可能因虚假正样本对而损害下游任务准确率。
- 利用期望校准误差(ECE)作为诊断工具,分析模型在对比对上的预测与真实下游标签之间的一致性差异。
- 提出一种通用正则化方法 Contrast-Reg,确保最小化对比损失能提升下游性能,而非过拟合到噪声或错位的对比对。
- 在多种图对比学习算法、GNN 主干网络和下游任务上验证 Contrast-Reg 的有效性,确立其广泛适用性与泛化优势。
提出的方法
- 将 ECE 适配用于图对比学习,量化对比对上预测相似性与真实下游标签一致性的错位程度。
- 识别导致模型校准偏差的两个关键因素:(1) 随机采样节点对的期望相似性,以及 (2) 正样本对的标签一致概率。
- 提出 Contrast-Reg,一种取值在 (0,1] 区间的正则化向量 r,强制要求节点表示与 r 保持相似,同时伪负样本(特征打乱后的样本)与 r 保持不相似。
- 将 Contrast-Reg 作为即插即用的正则项集成到现有对比学习框架中,通过修改损失函数,鼓励模型学习到更具泛化能力的表示。
- 理论分析表明,Contrast-Reg 通过降低 Rademacher 复杂度,减小了泛化误差上界,从而为下游性能提升提供理论依据。
- 通过实证验证,Contrast-Reg 在多种对比学习算法(如 ML、LC、GCA、GRACE)、GNN 主干网络(GAT、GIN)以及下游任务(节点分类、链接预测)上表现优异,使用 Cora、Citeseer、PubMed、Wiki 和 Computers 等标准基准数据集。
实验结果
研究问题
- RQ1为何在无监督图对比学习中,某些对比对即使在对比损失降低的情况下仍会降低下游性能?
- RQ2如何度量模型在对比对上的预测与真实下游标签一致性的差异?
- RQ3正则化方法在多大程度上能提升对比损失最小化与下游任务准确率之间的对齐程度?
- RQ4所提出的正则化方法 Contrast-Reg 是否在不同 GNN 架构和对比学习框架中均有效?
- RQ5Contrast-Reg 是否能泛化到其他自监督图学习方法(如图自编码器)中?
主要发现
- Contrast-Reg 在多个数据集上一致提升下游节点分类准确率,应用于 ML-GCN 时在 Cora 上提升高达 5.1%,在 PubMed 上提升 2.9%。
- 在 Cora 数据集上,使用 GAT 主干的 ML 模型在引入 Contrast-Reg 后准确率达到 81.56%,相较无正则化时的 76.90% 显著提升,表明其在不同架构下均具稳定性。
- 在 Cora 上,LC 搭配 GIN 主干时,Contrast-Reg 将准确率从 80.23% 提升至 81.38%,证实其在不同相似性定义与主干网络下的有效性。
- Contrast-Reg 超越标准正则化技术(如 ℓ2 归一化和权重衰减),表明其在缓解对比学习中校准偏差方面更具优势。
- 实证结果表明,Contrast-Reg 同样提升 GraphMAE(图自编码器)的性能,暗示其在对比学习之外也具备潜在的广泛适用性。
- 理论分析证实,Contrast-Reg 降低了泛化误差上界,通过减少 Rademacher 复杂度,为模型泛化能力的提升提供了理论支持。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。