Skip to main content
QUICK REVIEW

[论文解读] Layer-Neighbor Sampling -- Defusing Neighborhood Explosion in GNNs

Muhammed Fatih Balın, Ümit V. Çatalyürek|arXiv (Cornell University)|Oct 24, 2022
Advanced Graph Neural Networks被引用 10
一句话总结

本文提出 LABOR,一种用于图神经网络(GNNs)的新型图采样方法,通过泊松采样结合邻居采样与层采样,有效缓解邻域爆炸问题。通过相关联地采样种子节点之间的重叠邻域,LABOR 将顶点和边的数量分别减少至最多 7× 和 13×,从而在保持或提升模型收敛性与性能的同时,使批量大小达到邻居采样方法的 112×。

ABSTRACT

Graph Neural Networks (GNNs) have received significant attention recently, but training them at a large scale remains a challenge. Mini-batch training coupled with sampling is used to alleviate this challenge. However, existing approaches either suffer from the neighborhood explosion phenomenon or have poor performance. To address these issues, we propose a new sampling algorithm called LAyer-neighBOR sampling (LABOR). It is designed to be a direct replacement for Neighbor Sampling (NS) with the same fanout hyperparameter while sampling up to 7 times fewer vertices, without sacrificing quality. By design, the variance of the estimator of each vertex matches NS from the point of view of a single vertex. Moreover, under the same vertex sampling budget constraints, LABOR converges faster than existing layer sampling approaches and can use up to 112 times larger batch sizes compared to NS.

研究动机与目标

  • 解决大规模图上进行小批量训练时 GNN 中的邻域爆炸问题。
  • 克服现有邻居采样与层采样方法的局限性——特别是邻居采样的高方差与层采样的收敛性差问题。
  • 设计一种采样策略,在保持邻居采样方差特性的同时,显著减少采样顶点与边的数量。
  • 在相同采样预算下,实现远超以往的批量大小,从而加速训练收敛。
  • 提供一种灵活高效的采样框架,可根据硬件特性(如特征访问速度)进行调优。

提出的方法

  • 以泊松采样替代层采样中的无放回采样,降低方差并提升计算效率。
  • 提出 LABOR(LAyer-neighBOR sampling),一种以顶点方差为中心的框架,通过关联种子节点间的采样过程,最大化邻域重叠。
  • 将采样问题建模为优化任务:在保持每个顶点的邻居采样方差与邻居采样一致的前提下,最小化采样顶点数量。
  • 使用定点迭代法求解该优化问题,通过迭代更新采样分布直至收敛。
  • 引入 LABOR-*、LABOR-1 和 LABOR-0 等变体,其中 * 表示迭代至收敛,数字越小则越优先考虑更快的特征访问。
  • 将泊松采样集成至 LADIES 层采样框架中,构建 PLADIES,作为性能更优的基线方法。

实验结果

研究问题

  • RQ1能否设计一种采样方法,在保持邻居采样低方差估计器特性的同时,避免邻域爆炸?
  • RQ2如何改进基于层的采样方法,以在不牺牲模型质量的前提下,显著减少采样顶点与边的数量?
  • RQ3在固定采样预算下,通过更高效的采样策略,批量大小最多可提升多少?
  • RQ4在 GNN 训练背景下,定点迭代对收敛性与采样效率有何影响?
  • RQ5在不同硬件 I/O 特性下,采样变体的选择(如 LABOR-0 与 LABOR-*)对性能有何影响?

主要发现

  • 与邻居采样相比,LABOR 将采样顶点数减少最多 7×,边数减少最多 13×,显著缓解了邻域爆炸问题。
  • 在相同顶点采样预算下,LABOR 在 Reddit 数据集上使批量大小达到邻居采样的 112×,显著加速了收敛。
  • LABOR 的收敛速度优于邻居采样与 LADIES,训练与验证损失曲线更平滑、更稳定。
  • 定点迭代使最后一层采样顶点数减少 14%–33%,其中大部分改进在首次迭代中完成。
  • LABOR-0 因采样边数更少且无定点迭代开销,运行时间表现最佳,适用于慢速存储系统。
  • PLADIES(LADIES 的泊松采样变体)在 F1 分数上相比原始 LADIES 最高提升 2%,证明了泊松采样的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。