[论文解读] Learning by Sampling and Compressing: Efficient Graph Representation Learning with Extremely Limited Annotations
本文提出了一种新颖的训练框架,结合通过多重依赖随机游走实现的自适应采样与基于张量-列车(tensor-train)的模型压缩技术,实现了在极低标注数据量下的高效图表示学习。通过将训练数据减少高达90%,并将模型参数压缩超过6倍,该方法在六个基线模型和三个真实世界数据集上保持或提升了基于GCN模型的性能。
Graph convolution network (GCN) attracts intensive research interest with broad applications. While existing work mainly focused on designing novel GCN architectures for better performance, few of them studied a practical yet challenging problem: How to learn GCNs from data with extremely limited annotation? In this paper, we propose a new learning method by sampling strategy and model compression to overcome this challenge. Our approach has multifold advantages: 1) the adaptive sampling strategy largely suppresses the GCN training deviation over uniform sampling; 2) compressed GCN-based methods with a smaller scale of parameters need fewer labeled data to train; 3) the smaller scale of training data is beneficial to reduce the human resource cost to label them. We choose six popular GCN baselines and conduct extensive experiments on three real-world datasets. The results show that by applying our method, all GCN baselines cut down the annotation requirement by as much as 90$\%$ and compress the scale of parameters more than 6$ imes$ without sacrificing their strong performance. It verifies that the training method could extend the existing semi-supervised GCN-based methods to the scenarios with the extremely small scale of labeled data.
研究动机与目标
- 解决在标注数据极度稀缺时训练图卷积网络(GCNs)的挑战。
- 通过最小化训练所需的标注节点数量,降低人工标注成本。
- 通过改进采样策略,提升模型泛化能力并减少因采样策略不佳导致的训练偏差。
- 在不改变架构的前提下,使现有基于GCN的模型在低数据环境下仍能有效运行。
- 开发一种可泛化的框架,整合采样与压缩技术,实现可扩展的、低资源依赖的图学习。
提出的方法
- 采用多重依赖随机游走采样代表性节点子集,相比均匀采样,能提升分布覆盖度。
- 利用标签密度估计理论证明,随机游走采样比均匀采样能获得更具代表性的节点。
- 应用张量-列车(TT)分解压缩GCN权重矩阵,将参数量从$O(b \times c)$降低至$O(d \times r \times \max(b,c))$,其中$r \ll \min(b,c)$。
- 将采样与压缩步骤整合进统一的训练流水线:先采样节点,再在缩减的数据集上训练压缩后的模型。
- 利用动态规划在TT压缩模型的反向传播过程中高效计算梯度,通过核矩阵$G_k$上的链式法则实现。
- 使用标准优化方法训练压缩后的模型,并采用早停策略,仅使用采样节点进行监督。
实验结果
研究问题
- RQ1当标注数据极度稀缺时,基于多重依赖随机游走的采样策略是否在模型性能上优于均匀采样?
- RQ2张量-列车分解在不牺牲性能的前提下,能在多大程度上减少基于GCN模型的可训练参数数量?
- RQ3自适应采样与模型压缩的结合是否能使基于GCN的模型仅使用10–50%的原始标注数据,便达到全数据训练的性能水平?
- RQ4该框架在不同GCN架构和真实世界图数据集上的泛化能力如何?
- RQ5模型压缩与训练时间之间的权衡是什么?额外的计算成本是否由性能提升与数据效率增益所合理化?
主要发现
- 所有六个基于GCN的基线模型在仅使用原始标注数据10–50%的情况下,经由该框架训练后,性能均达到相当或更优水平。
- 在所有评估的数据集和模型上,该方法将所需标注预算减少了高达90%。
- 通过张量-列车分解,模型参数压缩超过6倍,显著降低了模型大小与对训练数据的依赖。
- 该框架仅引入16%的训练时间增加,这一代价在数据效率与模型紧凑性提升方面是合理的。
- 理论分析证实,随机游走采样相比均匀采样能实现更优的标签分布覆盖,从而减少训练偏差。
- 在多标签节点分类任务上的实证结果表明,该方法在多种真实世界图上均表现出一致的性能提升与鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。