Skip to main content
QUICK REVIEW

[论文解读] Relation Matters in Sampling: A Scalable Multi-Relational Graph Neural Network for Drug-Drug Interaction Prediction

Arthur Feeney, Rishabh Gupta|arXiv (Cornell University)|May 28, 2021
Advanced Graph Neural Networks参考文献 21被引用 8
一句话总结

本文提出 RS-GCN,一种可扩展的多关系图神经网络,通过学习与关系相关的采样概率来提升药物-药物相互作用(DDI)预测性能。通过采用基于 REINFORCE 的方法,根据局部邻域统计信息自适应地分配不同关系类型的采样权重,RS-GCN 在训练速度上比非采样基线快 2.47 倍,在推理速度上快 1.92 倍,同时有效缓解了 DDI 数据中的类别不平衡问题,达到当前最优性能。

ABSTRACT

Sampling is an established technique to scale graph neural networks to large graphs. Current approaches however assume the graphs to be homogeneous in terms of relations and ignore relation types, critically important in biomedical graphs. Multi-relational graphs contain various types of relations that usually come with variable frequency and have different importance for the problem at hand. We propose an approach to modeling the importance of relation types for neighborhood sampling in graph neural networks and show that we can learn the right balance: relation-type probabilities that reflect both frequency and importance. Our experiments on drug-drug interaction prediction show that state-of-the-art graph neural networks profit from relation-dependent sampling in terms of both accuracy and efficiency.

研究动机与目标

  • 解决图神经网络(GNN)在大规模、密集、多关系生物医学图(如药物-药物相互作用,DDI)网络中的可扩展性挑战。
  • 通过建模关系类型重要性(超越邻域采样中的频率)来提升 DDI 图中的链接预测性能。
  • 开发一种可学习的采样策略,使其能够根据局部邻域统计信息自适应调整,从而提升准确率与效率。
  • 通过学习关系特定的概率实现采样过程的可解释性,反映关系类型的频率与任务特定的重要性。

提出的方法

  • 提出 RS-GCN,作为关系图卷积网络(R-GCN)的扩展,引入与关系相关的采样概率。
  • 采用基于 REINFORCE 的强化学习方法,为每种关系类型学习可学习的采样概率,以优化链接预测性能。
  • 对目标边的两个节点均进行邻域采样,关系类型概率根据局部邻域的边类型分布进行更新。
  • 使用可微分的采样机制,支持端到端训练与推理,并实现基于关系类型的自适应采样。
  • 采用基于 GAE 的架构,结合关系特定的消息传递与采样机制,在保持模型表达能力的同时提升可扩展性。
  • 结合全局数据统计与局部邻域上下文,动态提高对重要但稀少的关系类型更高的采样权重。

实验结果

研究问题

  • RQ1学习关系特定的采样概率是否能提升 GNN 在大规模、密集、多关系 DDI 图上的性能与效率?
  • RQ2RS-GCN 学习到的关系类型概率与固定策略(如逆频率或随机采样)相比,在预测准确率与运行时间方面表现如何?
  • RQ3关系依赖的采样在缓解 DDI 预测中类别不平衡问题(尤其是稀有相互作用类型)方面有多大的帮助?
  • RQ4学习到的采样概率是否能提供对哪些关系类型对链接预测最具信息量的可解释性洞察?

主要发现

  • 在 Twosides100 数据集上,RS-GCN 的训练速度比非采样 R-GAE 基线快 2.47 倍,推理速度快 1.92 倍,且未牺牲 PR-AUC 性能。
  • 在 Twosides100 与 Drugbank 两个数据集上,RS-GCN 在预测性能上均优于当前最优基线模型,包括 IFR-GAE 与 RW-GCN。
  • 该模型学习到的采样概率反映了关系类型的频率与任务特定的重要性,对稀有但关键的相互作用(如 Twosides100 中的“创伤性出血”)分配了更高的权重。
  • 在 Drugbank 数据集中,最频繁的 DDI 类型(“增加不良反应风险或严重性”)被分配最低的采样概率,而最稀有的类型(“增加高钾血症风险或严重性”)则获得最高的采样概率,表明其有效处理了类别不平衡问题。
  • 学习到的概率并非全局固定,而是根据局部邻域结构自适应调整,从而在泛化能力上优于固定的逆频率策略。
  • 可视化结果表明,即使在边类型频率相同的邻域中,RS-GCN 分配的采样概率也与 IFR-GAE 不同,证明其具备超越频率加权的、任务感知的自适应能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。