Skip to main content
QUICK REVIEW

[논문 리뷰] Graph Neural Prompting with Large Language Models

Yijun Tian, Huan Song|arXiv (Cornell University)|2023. 09. 27.
Topic ModelingComputer Science인용 수 3
한 줄 요약

이 논문은 그래프 신경망(GNNs), 교차 모odal 풀링, 도메인 프로젝션, 그리고 자기지도 링크 예측을 통해 지식 그래프(KGs)에서 구조화된 지식을 추출하고 주입함으로써 동결되거나 미세조정된 대규모 언어 모델(LLMs)을 향상시키는 플러그 앤 플레이 방법인 그래프 신경망 프롬프팅(GNP)을 제안한다. GNP는 LLM의 파라미터를 업데이트하지 않고도 일반지식 및 생물의학적 추론 작업에서 제로샷 및 미세조정된 LLM 성능을 최대 +13.5% 향상시킨다.

ABSTRACT

Large language models (LLMs) have shown remarkable generalization capability with exceptional performance in various language modeling tasks. However, they still exhibit inherent limitations in precisely capturing and returning grounded knowledge. While existing work has explored utilizing knowledge graphs (KGs) to enhance language modeling via joint training and customized model architectures, applying this to LLMs is problematic owing to their large number of parameters and high computational cost. Therefore, how to enhance pre-trained LLMs using grounded knowledge, e.g., retrieval-augmented generation, remains an open question. In this work, we propose Graph Neural Prompting (GNP), a novel plug-and-play method to assist pre-trained LLMs in learning beneficial knowledge from KGs. GNP encompasses various designs, including a standard graph neural network encoder, a cross-modality pooling module, a domain projector, and a self-supervised link prediction objective. Extensive experiments on multiple datasets demonstrate the superiority of GNP on both commonsense and biomedical reasoning tasks across different LLM sizes and settings. Code is available at https://github.com/meettyj/GNP.

연구 동기 및 목표

  • 대규모 언어 모델(LLMs)이 정확하게 지문 기반 사실 지식을 검색하고 활용하는 데에 내재된 한계를 해결하기 위해.
  • 전체 미세조정이나 맞춤형 아키텍처 설계 없이 사전 훈련된 LLM이 지식 그래프(KGs)의 이점을 얻을 수 있도록 하기 위해.
  • 학습 가능한 프롬프트를 통해 지식 그래프에서 구조화된 지식을 LLM에 효율적으로 주입하는 플러그 앤 플레이 프레임워크를 개발하기 위해.
  • 하류 추론 작업을 위한 엔티티와 관계 이해를 향상시키기 위해 자기지도 그래프 학습을 탐구하기 위해.

제안 방법

  • 지식 그래프를 처리하여 관계적 구조를 반영하는 노드 수준의 임베딩을 생성하는 그래프 신경망(GNN) 인코더.
  • 입력 텍스트에 기반하여 가장 관련성이 높은 KG 노드 임베딩을 식별하고 집계함으로써 통합된 그래프 수준의 프롬프트 임베딩을 생성하는 교차 모달 풀링 모듈.
  • KG와 LLM 간의 모odal 갭을 해소하기 위해 그래프 임베딩의 분포를 텍스트 공간과 정렬하는 도메인 프로젝터.
  • GNP 모듈을 사전 훈련하기 위해 자기지도 링크 예측 목적이 사용되며, 이는 모델이 의미 있는 엔티티 관계를 학습하는 능력을 향상시킨다.
  • 최종적으로 그래프 신경망 프롬프트는 동결 또는 LoRA 미세조정 설정에서 맥락 인식형, 지식 기반 지시문으로 LLM에 주입된다.
  • 이 방법은 LLM 아키텍처나 파라미터를 수정할 필요 없이 플러그 앤 플레이로 설계되어 있다.

실험 결과

연구 질문

  • RQ1플러그 앤 플레이 방법이 사전 훈련된 대규모 언어 모델에 지식 그래프에서 지식을 효과적으로 추출하고 주입할 수 있는가?
  • RQ2그래프 신경망 프롬프팅은 추론 작업에서 제로샷 및 파라미터 효율적 미세조정 성능을 어떻게 향상시키는가?
  • RQ3GNN의 깊이와 교차 모달 풀링 레이어의 영향은 다양한 LLM 크기와 데이터셋에서 성능에 어떻게 작용하는가?
  • RQ4자기지도 링크 예측 목적이 모델이 관련성이 높은 KG 구조를 학습하는 데 어떻게 기여하는가?

주요 결과

  • GNP는 일반지식 및 생물의학적 추론 작업에서 여섯 개의 벤치마크 데이터셋 평균적으로 동결된 LLM의 성능을 +13.5% 향상시켰다.
  • LoRA 미세조정과 함께 사용할 경우, 지식 주입 없이 기존의 미세조정보다 +1.8% 성능 향상을 기록했다.
  • 12개 평가 중 10개에서 전체 미세조정과 경쟁하거나 슈퍼어리어한 결과를 달성하여 뛰어난 파라미터 효율성을 입증했다.
  • 최적의 GNN 레이어 수는 데이터셋과 LLM 크기에 따라 달라지며, OBQA에서 3B 모델에는 3개 레이어가 최적이고, PubMedQA에서 11B 모델에는 5개 레이어가 최적이다.
  • 교차 모달 풀링 깊이의 영향은 데이터셋과 모델 크기에 따라 다르게 나타났다: OBQA에서 11B LLM에서는 더 깊은 풀링이 유리하지만, BioASQ에서는 성능 저하를 초래하여 아키텍처 선택에 민감함을 보였다.
  • 사례 연구 결과, GNP는 텍스트에 구조적으로 관련된 서브그래프를 추출하여 핵심 엔티티와 관계를 포함함으로써, 노이즈가 있거나 관련 없는 정보를 포함한 원본 지식 그래프에서도 정확한 추론을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.