Skip to main content
QUICK REVIEW

[논문 리뷰] PiVe: Prompting with Iterative Verification Improving Graph-based Generative Capability of LLMs

Jiuzhou Han, Nigel Collier|arXiv (Cornell University)|2023. 05. 21.
Natural Language Processing Techniques인용 수 6
한 줄 요약

이 논문은 경량 검증 모델을 사용한 반복적 검증을 통해 대규모 언어 모델(Large Language Models, LLMs)의 그래프 생성 능력을 향상시키는 PiVe 프레임워크를 제안한다. 자기지도 학습을 위한 펌프팅된 그래프-텍스트 쌍을 생성함으로써 검증 모델은 루프 내에서 수정 피드백을 제공하며, 세 가지 데이터셋에서 평균 26% 향상된 의미적 그래프 품질을 달성하고, GenWiki-HIQ와 같은 고품질 텍스트-그래프 데이터셋의 데이터 증강을 가능하게 한다.

ABSTRACT

Large language models (LLMs) have shown great abilities of solving various natural language tasks in different domains. Due to the training objective of LLMs and their pre-training data, LLMs are not very well equipped for tasks involving structured data generation. We propose a framework, Prompting with Iterative Verification (PiVe), to improve graph-based generative capability of LLMs. We show how a small language model could be trained to act as a verifier module for the output of an LLM~(i.e., ChatGPT, GPT-4), and to iteratively improve its performance via fine-grained corrective instructions. We also show how the verifier module could apply iterative corrections offline for a more cost-effective solution to the text-to-graph generation task. Experiments on three graph-based datasets show consistent improvement gained via PiVe. Additionally, we create GenWiki-HIQ and highlight that the verifier module can be used as a data augmentation tool to help improve the quality of automatically generated parallel text-graph datasets.

연구 동기 및 목표

  • LLMs가 비구조화된 텍스트 작업에서는 성공을 거두었음에도 불구하고, 텍스트에서 구조화된 의미적 그래프를 생성하는 데에는 낮은 성능을 보이는 문제를 해결하기 위해.
  • 외부 검증 모듈을 통해 반복적인 수정 피드백을 제공하는 비용 효율적인 방법을 개발하여 LLM 기반 텍스트-그래프 생성을 향상시키기 위해.
  • 검증 모듈을 데이터 증강 도구로 활용하여 고품질의 대규모 텍스트-그래프 데이터셋(GenWiki-HIQ)을 구축하기 위해.
  • 확장성과 효율성을 고려한 온라인 반복 프롬프팅 및 오프라인 보정 모드를 탐색하기 위해.
  • 다양한 도메인과 작업에 광범위하게 적용 가능한 통합 검증 모델을 피지컬 토닝 및 지시 토닝을 통해 훈련하기 위해.

제안 방법

  • 기본 그래프-텍스트 쌍에서 엔티티, 관계 또는 삼중항을 변형하여 대규모 검증 데이터셋을 구성하고, (텍스트, 펌프팅된 그래프, 수정 지시) 삼중항을 생성한다.
  • 펌프팅 기반 데이터셋에서 자기지도 학습을 통해 LLM이 생성한 그래프의 오류를 탐지하고 수정할 수 있도록 검증 모델을 훈련한다.
  • 두 가지 모드를 구현한다: (1) 반복적 프롬프팅은 검증 모델이 실시간으로 LLM 프롬프트를 개선하는 데 피드백을 제공하고, (2) 반복적 오프라인 보정은 LLM을 재질의하지 않고 순차적으로 수정을 적용한다.
  • 지시 토닝을 사용하여 다양한 데이터셋과 작업에 일반화할 수 있는 통합 검증 모델을 훈련한다.
  • 훈련된 검증 모델을 데이터 필터링 및 보정 도구로 활용하여 자동으로 구성된 텍스트-그래프 데이터셋의 품질을 향상시킨다.
  • 검증 모델을 활용하여 의미적 중첩도가 높은 11만 개의 텍스트-그래프 쌍을 포함하는 고품질 데이터셋인 GenWiki-HIQ를 생성한다.
Figure 1: Framework of PiVe.
Figure 1: Framework of PiVe.

실험 결과

연구 질문

  • RQ1외부 검증 모델이 소수의 프롬프팅 설정에서 LLM이 생성한 의미적 그래프의 품질을 크게 향상시킬 수 있는가?
  • RQ2수정 피드백을 제공하는 반복적 검증이 LLM 생성 그래프의 구조적 오류를 줄이는 데 얼마나 효과적인가?
  • RQ3지시 토닝을 통해 단일 통합 검증 모델이 다양한 텍스트-그래프 데이터셋에 일반화할 수 있는가?
  • RQ4검증 모듈이 자동으로 구성된 텍스트-그래프 데이터셋의 품질 향상에 있어 데이터 증강 도구로 얼마나 효과적으로 기능할 수 있는가?
  • RQ5온라인 반복 프롬프팅에 비해 추론 비용을 줄이면서도 오프라인 보정 모드가 높은 성능을 유지할 수 있는가?

주요 결과

  • PiVe 프레임워크는 세 가지 벤치마크 데이터셋에서 평균 26% 향상된 성능을 보이며, LLM이 생성한 의미적 그래프의 품질을 일관되게 향상시켰다.
  • 검증 모델은 LLM 기반 텍스트-그래프 생성에서 흔히 발생하는 누락된 삼중항을 효과적으로 탐지하고 수정하였다.
  • 지시 토닝을 통해 훈련된 통합 검증 모델은 다양한 데이터셋 간에 잘 일반화되었으며, 강력한 제로샷 전이 능력을 보였다.
  • 오프라인 보정 모드는 온라인 반복 프롬프팅과 유사한 성능을 달성하면서도 LLM의 추론 비용을 줄였다.
  • 검증 모듈은 자동으로 구성된 텍스트-그래프 데이터셋의 품질을 성공적으로 향상시켜, 의미적 중첩도가 높은 11만 개의 텍스트-그래프 쌍을 포함하는 고품질 데이터셋인 GenWiki-HIQ를 생성하는 데 기여했다.
  • 펌프팅 기반의 데이터 생성 전략은 최소한의 인간 레이블링으로도 확장 가능한 자기지도 학습을 가능하게 하였다.
Figure 2: Results of various number of shots (k=6, 8, 10) on KELM-sub with Iterative Offline Correction. The colors represent Base , and corrective iterations 1 , 2 , 3 .
Figure 2: Results of various number of shots (k=6, 8, 10) on KELM-sub with Iterative Offline Correction. The colors represent Base , and corrective iterations 1 , 2 , 3 .

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.