[论文解读] Metropolis-Hastings Data Augmentation for Graph Neural Networks
该论文提出了一种名为马尔可夫链蒙特卡洛数据增强(MH-Aug)的新框架,通过显式目标分布使用马尔可夫链蒙特卡洛采样生成图数据增强,实现对图神经网络的可控且多样化的数据增强。MH-Aug通过确保增强后的图遵循期望分布,提升了半监督学习中GNN的泛化能力,在五个基准数据集上实现了最先进性能。
Graph Neural Networks (GNNs) often suffer from weak-generalization due to sparsely labeled data despite their promising results on various graph-based tasks. Data augmentation is a prevalent remedy to improve the generalization ability of models in many domains. However, due to the non-Euclidean nature of data space and the dependencies between samples, designing effective augmentation on graphs is challenging. In this paper, we propose a novel framework Metropolis-Hastings Data Augmentation (MH-Aug) that draws augmented graphs from an explicit target distribution for semi-supervised learning. MH-Aug produces a sequence of augmented graphs from the target distribution enables flexible control of the strength and diversity of augmentation. Since the direct sampling from the complex target distribution is challenging, we adopt the Metropolis-Hastings algorithm to obtain the augmented samples. We also propose a simple and effective semi-supervised learning strategy with generated samples from MH-Aug. Our extensive experiments demonstrate that MH-Aug can generate a sequence of samples according to the target distribution to significantly improve the performance of GNNs.
研究动机与目标
- 为解决图结构化数据中因标签稀疏导致图神经网络(GNNs)泛化能力差的问题。
- 克服由于图的非欧几里得结构和节点依赖性,难以设计有效且保持标签一致性的图数据增强方法的挑战。
- 通过明确定义的目标分布,实现对增强强度和多样性的显式控制。
- 开发一种利用顺序生成的增强样本提升模型性能的半监督学习策略。
提出的方法
- MH-Aug将数据增强建模为马尔可夫链蒙特卡洛(MCMC)采样问题,从显式目标分布中抽取增强图。
- 通过控制边删除概率的均值($\mu_{\mathcal{E}}$)和标准差($\sigma_{\mathcal{E}}$)参数,定义图修改上的目标分布,以实现期望的增强强度和多样性。
- 在目标分布中引入归一化项,以应对可能子图数量的组合爆炸问题,确保对期望图变化比例的精确控制。
- MH-Aug采用梅特罗波利斯-黑斯廷斯算法从复杂目标分布中采样,即使无法直接采样,也能实现向期望分布的收敛。
- 引入自指图(ego-graph)视角,基于目标节点周围结构变化来衡量增强强度,从而实现更可解释且有效的扰动。
- 通过利用未标记数据并应用多个同一图的增强视图进行正则化,将框架与一致性训练相结合。
实验结果
研究问题
- RQ1基于MCMC的采样能否有效生成多样化且保持标签一致性的图增强?
- RQ2所提出的目標分布能否实现对增强强度和多样性的显式、可解释的控制?
- RQ3在复杂图结构上,MH-Aug在实际中是否能收敛到期望的目标分布?
- RQ4MH-Aug能否与一致性训练有效结合,以提升半监督GNN的性能?
- RQ5在多样化图数据集上,MH-Aug与现有数据增强基线相比,在泛化能力和鲁棒性方面表现如何?
主要发现
- MH-Aug成功生成了一组收敛至期望目标分布的增强图,实验采样结果在网格图上得到验证。
- 目标分布中包含的归一化项对于在密集图中实现对期望图变化比例的精确控制至关重要。
- MH-Aug实现了对增强强度和多样性的灵活控制:增加 $\mu_{\mathcal{E}}$ 会导致更显著的结构变化,而增加 $\sigma_{\mathcal{E}}$ 则会使边删除概率更加均匀。
- 当 $\sigma_{\mathcal{E}}$ 较大时,该方法退化为DropEdge的特例,证实了其通用性与对先前工作的兼容性。
- MH-Aug在五个基准数据集的节点分类任务中均达到最先进性能,显著优于强基线模型。
- 消融实验表明,归一化项至关重要——若无该归一化项,图变化比例的经验均值将无法匹配目标 $\mu_{\mathcal{E}}$,表明其收敛至非期望分布。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。