Skip to main content
QUICK REVIEW

[论文解读] GraphText: Graph Reasoning in Text Space

Jianan Zhao, Le Zhuo|arXiv (Cornell University)|Oct 2, 2023
Topic Modeling被引用 4
一句话总结

GRAPHTEXT 是一种新颖的框架,通过图-语法树遍历将图转化为自然语言提示,在文本空间中实现图推理。该框架无需训练即可实现最先进的图推理性能,与微调过的图神经网络(GNN)相当甚至更优,利用上下文学习实现,同时支持自然语言中的交互式、可解释的人机协作。

ABSTRACT

Large Language Models (LLMs) have gained the ability to assimilate human knowledge and facilitate natural language interactions with both humans and other LLMs. However, despite their impressive achievements, LLMs have not made significant advancements in the realm of graph machine learning. This limitation arises because graphs encapsulate distinct relational data, making it challenging to transform them into natural language that LLMs understand. In this paper, we bridge this gap with a novel framework, GraphText, that translates graphs into natural language. GraphText derives a graph-syntax tree for each graph that encapsulates both the node attributes and inter-node relationships. Traversal of the tree yields a graph text sequence, which is then processed by an LLM to treat graph tasks as text generation tasks. Notably, GraphText offers multiple advantages. It introduces training-free graph reasoning: even without training on graph data, GraphText with ChatGPT can achieve on par with, or even surpassing, the performance of supervised-trained graph neural networks through in-context learning (ICL). Furthermore, GraphText paves the way for interactive graph reasoning, allowing both humans and LLMs to communicate with the model seamlessly using natural language. These capabilities underscore the vast, yet-to-be-explored potential of LLMs in the domain of graph machine learning.

研究动机与目标

  • 弥合图结构数据与大语言模型(LLMs)之间的鸿沟,后者传统上缺乏对图推理的原生支持。
  • 通过在大语言模型中利用上下文学习(in-context learning)而无需在图数据上微调,实现无需训练的图推理。
  • 通过允许人类与大语言模型以自然语言交流,促进人机之间的交互式、可解释的图推理。
  • 通过统一框架泛化于多种图类型,包括连续特征图和文本属性图。

提出的方法

  • 构建一个图-语法树,以分层结构编码节点属性(特征、标签)和节点间关系(例如,中心节点、一跳、二跳)。
  • 以深度优先方式遍历图-语法树,生成表示图的自然语言序列提示。
  • 将生成的图提示输入预训练的大语言模型,将图推理作为文本生成任务执行。
  • 支持上下文学习(ICL)和指令微调(例如,对 Llama-2 进行 LoRA 微调),以适应大语言模型执行图任务。
  • 通过将连续节点特征映射到大语言模型的嵌入空间,同时将原始文本属性视为离散标记,实现多模态输入处理。
  • 利用大语言模型的推理能力生成逐步解释和预测,提升可解释性。

实验结果

研究问题

  • RQ1是否可以在不微调图数据的情况下,在自然语言空间中有效执行图推理?
  • RQ2使用 GRAPHTEXT 的大语言模型在图分类任务中的性能与监督式 GNN 相比如何?
  • RQ3GRAPHTEXT 是否能够支持人类与大语言模型通过自然语言进行交互式推理?
  • RQ4该框架在不同图类型(包括文本属性图和连续特征图)上的泛化能力如何?
  • RQ5输入模态(原始文本与连续特征)对 GRAPHTEXT 框架中大语言模型性能的影响是什么?

主要发现

  • 使用 ChatGPT 的 GRAPHTEXT 在 Cora 上实现 67.77% 的节点分类准确率,在 Citeseer 上实现 68.98%,在某些设置下优于 GNN 基线模型。
  • 在 Llama-2-7B 上进行 LoRA 微调的指令微调在 Cora 上实现 77.53% 的准确率,在 Citeseer 上实现 73.83%,尽管使用的是更小的开源模型,但已接近 GNN 性能。
  • 封闭源的大语言模型(如 ChatGPT)在处理连续特征时表现不佳,分别在 Cora 和 Citeseer 上仅实现 10.68% 和 16.14% 的准确率,这是由于其处理连续嵌入的固有局限性。
  • 开源大语言模型(如 Llama-2-7B)在连续特征上微调后性能显著提升(Cora 上达到 87.11%),表明当正确集成时,其对图数据具有良好的适应能力。
  • 该框架支持可解释推理:大语言模型可生成逐步解释,例如识别一跳标签为强预测因子,从而增强可解释性。
  • GRAPHTEXT 证明了无需训练的图推理是可行且有效的,仅通过上下文学习即可实现与监督式 GNN 相当或更优的性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。