Skip to main content
QUICK REVIEW

[论文解读] RIM: Reliable Influence-based Active Learning on Graphs

Wentao Zhang, Yexin Wang|arXiv (Cornell University)|Oct 28, 2021
Advanced Graph Neural Networks被引用 10
一句话总结

本文提出RIM,一种用于图神经网络的新型主动学习方法,通过统一影响力最大化与标签质量估计,选择信息量丰富且可靠的节点。通过同时建模影响力数量与质量,RIM在准确率上比SOTA方法如GPA高出2.2%–5.1%,运行时间最快提升18,652倍,尤其在标签噪声条件下表现更优。

ABSTRACT

Message passing is the core of most graph models such as Graph Convolutional Network (GCN) and Label Propagation (LP), which usually require a large number of clean labeled data to smooth out the neighborhood over the graph. However, the labeling process can be tedious, costly, and error-prone in practice. In this paper, we propose to unify active learning (AL) and message passing towards minimizing labeling costs, e.g., making use of few and unreliable labels that can be obtained cheaply. We make two contributions towards that end. First, we open up a perspective by drawing a connection between AL enforcing message passing and social influence maximization, ensuring that the selected samples effectively improve the model performance. Second, we propose an extension to the influence model that incorporates an explicit quality factor to model label noise. In this way, we derive a fundamentally new AL selection criterion for GCN and LP--reliable influence maximization (RIM)--by considering quantity and quality of influence simultaneously. Empirical studies on public datasets show that RIM significantly outperforms current AL methods in terms of accuracy and efficiency.

研究动机与目标

  • 解决图结构数据中节点标注成本高且易出错的问题。
  • 通过将节点选择建模为影响力最大化,统一主动学习与图卷积网络(GCN)中的消息传递机制及标签传播。
  • 通过引入质量因子显式建模标签噪声,以估计每个标签的可靠性。
  • 提出一种新的选择标准,平衡影响力数量与质量,从而在标签噪声条件下提升模型性能。
  • 在不依赖深度学习模型或GPU加速的前提下,实现高效且鲁棒的节点选择。

提出的方法

  • 将节点影响力定义为:通过GCN或LP中的消息传递机制,已标注节点对其他节点输出特征或标签的影响程度。
  • 为每个节点引入一个质量因子,表示其标签正确的概率,通过图边上的特征/标签平滑进行估计。
  • 提出一种可靠的影响力最大化(RIM)目标,联合优化影响力数量与质量,确保仅高质量影响力得以传播。
  • 使用贪心近似算法最大化可靠影响力,利用子模性性质实现(1−1/e)的近似比。
  • 通过图结构与特征相似性,递归传播已选节点的置信度,以估计标签质量。
  • 设计一种无需模型的轻量化框架,避免训练深层模型,从而实现在CPU和GPU上的高速推理。

实验结果

研究问题

  • RQ1能否通过将节点选择建模为影响力最大化,实现图模型主动学习与消息传递的统一?
  • RQ2如何显式建模标签噪声,以防止在消息传递过程中错误标签的传播?
  • RQ3影响力数量与质量的联合度量是否能带来优于现有方法的主动学习性能?
  • RQ4在不同标签噪声水平与数据集规模下,RIM在准确率与效率方面表现如何?
  • RQ5与基线方法相比,RIM在节点激活模式上是否保持可解释性与鲁棒性?

主要发现

  • 在标签准确率为70%时,即使使用抗噪声机制PTA,RIM在公开数据集上的预测准确率仍比GPA高出2.2%–5.1%。
  • 在GPU上,RIM相比GPA最快实现4,670倍加速;在CPU上,最快实现18,652倍加速,展现出卓越的效率。
  • 在30%标签噪声条件下,RIM保持强性能,显著优于在噪声条件下性能明显下降的基线方法。
  • 可解释性分析表明,RIM激活的正确节点数量多于AGE与RIM(No RS),且受噪声标签影响的误激活更少。
  • 可靠的影响力最大化目标具有子模性,支持使用贪心算法实现(1−1/e)的近似保证。
  • RIM在多种数据集(Cora、PubMed、Reddit)上表现稳健,无论数据规模如何,均在准确率与速度上保持一致的性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。