Skip to main content
QUICK REVIEW

[論文レビュー] Graph Neural Prompting with Large Language Models

Yijun Tian, Huan Song|arXiv (Cornell University)|Sep 27, 2023
Topic ModelingComputer Science被引用数 3
ひとこと要約

本稿では、グラフニューラルネットワーク(GNN)、クロスモodalプーリング、ドメインプロジェクション、自己教師付きリンク予測を介して、知識グラフ(KG)から構造化された知識を抽出・統合することで、凍結済みまたは微調整済みの大規模言語モデル(LLM)を強化する、プラグアンドプレイな手法であるグラフニューラルプロンプティング(GNP)を提案する。GNPは、LLMのパラメータを更新せずに、常識的および生物医学的推論タスクにおいて、ゼロショットおよび微調整済みのLLM性能を最大で+13.5%向上させる。

ABSTRACT

Large language models (LLMs) have shown remarkable generalization capability with exceptional performance in various language modeling tasks. However, they still exhibit inherent limitations in precisely capturing and returning grounded knowledge. While existing work has explored utilizing knowledge graphs (KGs) to enhance language modeling via joint training and customized model architectures, applying this to LLMs is problematic owing to their large number of parameters and high computational cost. Therefore, how to enhance pre-trained LLMs using grounded knowledge, e.g., retrieval-augmented generation, remains an open question. In this work, we propose Graph Neural Prompting (GNP), a novel plug-and-play method to assist pre-trained LLMs in learning beneficial knowledge from KGs. GNP encompasses various designs, including a standard graph neural network encoder, a cross-modality pooling module, a domain projector, and a self-supervised link prediction objective. Extensive experiments on multiple datasets demonstrate the superiority of GNP on both commonsense and biomedical reasoning tasks across different LLM sizes and settings. Code is available at https://github.com/meettyj/GNP.

研究の動機と目的

  • 大規模言語モデル(LLM)が事実的な知識を正確に取得・活用するという内在的な制限を解消すること。
  • 完全な微調整やカスタムアーキテクチャ設計を必要とせずに、事前学習済みLLMが知識グラフ(KG)の恩恵を受けることを可能にすること。
  • 学習可能なプロンプトを介して、KGから構造化された知識をLLMに効率的に統合する、プラグアンドプレイなフレームワークを開発すること。
  • 自己教師付きグラフ学習を活用し、下流の推論タスクにおけるエンティティおよび関係の理解を向上させること。

提案手法

  • グラフニューラルネットワーク(GNN)エンコーダーが、関係構造を捉えたノードレベルの埋め込みを生成するために知識グラフを処理する。
  • クロスモダリティプールモジュールが、入力テキストに基づいて最も関連性の高いKGノード埋め込みを特定・集約し、包括的なグラフレベルのプロンプト埋め込みを生成する。
  • ドメインプロジェクターが、KGの埋め込み分布とテキスト空間を一致させることで、KGとLLM間のモダリティギャップを埋める。
  • 自己教師付きリンク予測の目的関数を用いてGNPモジュールを事前学習し、意味のあるエンティティ関係を学習する能力を向上させる。
  • 最終的なグラフニューラルプロンプトは、文脈に適した知識に基づいた命令として、凍結済みまたはLoRA微調整済みの設定におけるLLMに統合される。
  • 本手法は、LLMのアーキテクチャやパラメータを変更することなく、プラグアンドプレイに設計されている。

実験結果

リサーチクエスチョン

  • RQ1プラグアンドプレイな手法が、知識グラフから知識を効果的に抽出・統合できるか?
  • RQ2グラフニューラルプロンプティングは、推論タスクにおけるゼロショットおよびパrameter効率的な微調整性能をどのように向上させるか?
  • RQ3GNNの深さとクロスモダリティプールのレイヤー数が、異なるLLMサイズおよびデータセットにおけるモデル性能に与える影響は何か?
  • RQ4自己教師付きリンク予測の目的関数は、モデルが関連するKG構造を学習する能力をどのように向上させるか?

主な発見

  • GNPは、常識的および生物医学的推論タスクにおける6つのベンチマークデータセット全体で、平均して凍結LLMの性能を+13.5%向上させる。
  • LoRA微調整と組み合わせた場合、GNPは知識統合なしのベースライン微調整に比べて+1.8%の性能向上を達成する。
  • 12回の評価のうち10回で、完全な微調整と同等または優れた結果を達成しており、優れたパrameter効率性を示している。
  • 最適なGNNレイヤー数はデータセットおよびLLMサイズに依存し、OBQAでは3Bモデルに対して3層が最適、PubMedQAでは11Bモデルに対して5層が最適である。
  • クロスモダリティプールの深さは、データセットおよびモデルサイズに依存する影響を示す:OBQAにおける11B LLMでは深さが性能向上に寄与するが、BioASQでは性能を低下させることがあり、アーキテクチャ選択の感受性を示している。
  • 事例研究では、GNPが、キーエンティティおよび関係を含む構造的に関連性の高い部分グラフを抽出できており、ノイズや不要な情報が含まれる原始的なKGであっても、正しい推論を可能にしている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。