Skip to main content
QUICK REVIEW

[논문 리뷰] Evaluating Generative Models for Graph-to-Text Generation

Shuzhou Yuan, Michael Färber|arXiv (Cornell University)|2023. 07. 27.
Topic ModelingComputer Science인용 수 3
한 줄 요약

이 논문은 GPT-3와 ChatGPT를 사용하여 AGENDA 및 WebNLG 데이터셋에서 zero-shot 그래프 텍스트 생성을 평가하며, T5 및 BART와 같은 미세조정된 모델과의 성능를 비교한다. BLEU 점수 10.57과 11.08을 기록하며 유창한 텍스트를 생성하지만, 생성 모델은 의미 관계 이해에 어려움을 겪고 환각 현상을 유발하며, 생성된 텍스트에 대해 미세조정된 BERT는 인간이 작성한 텍스트와 기계가 생성한 텍스트를 구분하는 데 95% 이상의 매크로-F1 점수를 기록한다.

ABSTRACT

Large language models (LLMs) have been widely employed for graph-to-text generation tasks. However, the process of finetuning LLMs requires significant training resources and annotation work. In this paper, we explore the capability of generative models to generate descriptive text from graph data in a zero-shot setting. Specifically, we evaluate GPT-3 and ChatGPT on two graph-to-text datasets and compare their performance with that of finetuned LLM models such as T5 and BART. Our results demonstrate that generative models are capable of generating fluent and coherent text, achieving BLEU scores of 10.57 and 11.08 for the AGENDA and WebNLG datasets, respectively. However, our error analysis reveals that generative models still struggle with understanding the semantic relations between entities, and they also tend to generate text with hallucinations or irrelevant information. As a part of error analysis, we utilize BERT to detect machine-generated text and achieve high macro-F1 scores. We have made the text generated by generative models publicly available.

연구 동기 및 목표

  • GPT-3와 ChatGPT와 같은 생성 모델이 구조화된 그래프 데이터에서 서술 텍스트를 생성하는 데 있어 zero-shot 능력을 평가하는 것.
  • T5 및 BART와 같은 미세조정된 순차-순차 모델과의 성능 비교를 통해 표준 그래프 텍스트 벤치마크에서의 성능를 평가하는 것.
  • 특히 의미 관계 이해와 환각 현상에 관여하는 생성 텍스트의 실패 유형 분석.
  • 이진 분류를 위한 미세조정된 BERT를 사용하여 기계 생성 텍스트의 탐지 가능성 조사.
  • 향후 신뢰할 수 있는 AI 및 기계 생성 텍스트 분석 연구를 위한 공개된 생성 텍스트 제공.

제안 방법

  • 선형화된 그래프 표현 방식을 GPT-3와 ChatGPT의 입력 프롬프트로 사용하여 구조화된 지식을 자연어 시퀀스로 변환한다.
  • 지문 템플릿을 사용해 모델에 그래프 트리플에서 텍스트를 생성하도록 프롬프트를 제공함으로써, 미세조정 없이 zero-shot 추론을 가능하게 한다.
  • AGENDA 및 WebNLG의 테스트 세트에서 BLEU, METEOR, ROUGE 등의 표준 지표를 사용해 성능을 평가한다.
  • 생성된 출력을 기준 텍스트와 비교하여 환각 현상과 관계 이해 실패를 식별하기 위해 오류 분석을 수행한다.
  • 인간이 작성한 텍스트와 기계가 생성한 텍스트 쌍을 기반으로 BERT 모델을 미세조정하여 텍스트 출처를 분류하는 이진 분류 작업을 수행하고, 매크로-F1 점수로 평가한다.
  • 모든 생성된 텍스트는 GitHub를 통해 공개되어 재현성 및 기계 생성 콘텐츠 분석을 위한 향후 연구를 지원한다.
(a) Generate paper abstract from title, entities and graph: <title> Significance-aware Hammerstein group models for nonlinear acoustic echo cancellation. <entities> non-linear preprocessor echo path hammerstein model <graph> <H> non-linear preprocessor <R> USED-FOR <T> echo path <H> preprocessor <R>
(a) Generate paper abstract from title, entities and graph: <title> Significance-aware Hammerstein group models for nonlinear acoustic echo cancellation. <entities> non-linear preprocessor echo path hammerstein model <graph> <H> non-linear preprocessor <R> USED-FOR <T> echo path <H> preprocessor <R>

실험 결과

연구 질문

  • RQ1GPT-3와 ChatGPT는 구조화된 그래프 데이터에서 zero-shot 환경에서 매끄럽고 일관성 있는 텍스트를 생성할 수 있는가?
  • RQ2생성 모델의 성능 지표(BLEU, METEOR, ROUGE)는 T5 및 BART와 같은 미세조정된 모델과 비교해 어떻게 다른가?
  • RQ3생성 모델이 그래프에서 텍스트를 생성할 때 일반적으로 발생하는 오류 유형은 무엇인가, 특히 의미 관계와 사실 일관성 측면에서?
  • RQ4미세조정된 BERT 분류기로 기계 생성 텍스트를 인간이 작성한 텍스트와 얼마나 잘 구별할 수 있는가?
  • RQ5동일한 입력 그래프로 프롬프트를 제공했을 때 GPT-3와 ChatGPT의 출력은 얼마나 재현 가능한가?

주요 결과

  • GPT-3와 ChatGPT는 각각 AGENDA 및 WebNLG 데이터셋에서 BLEU 점수 10.57과 11.08을 기록하여, 매끄럽지만 낮은 품질의 텍스트 생성을 수행한다.
  • 생성 모델는 'USED-FOR' 및 'PART-OF'와 같은 엔티티 간 의미 관계를 이해하지 못해 사실 오류를 유발한다.
  • ChatGPT는 중복되고 환각된 내용을 생성하며, 예를 들어 'Abner W. Sibal은 위대한 도전에 직면한 유명한 인물이었다'와 같은 주관적 진술을 포함한다.
  • GPT-3는 이름을 잘못 인식하여 'Abner W. Sibal'을 전투로 잘못 레이블링함으로써 사실 환각 현상을 보이다.
  • 미세조정된 BERT 모델은 통합 데이터셋에서 매크로-F1 점수 95.82를 기록하여 기계 생성 텍스트의 높은 탐지 가능성을 보여준다.
  • 결과는 낮은 재현성으로 인해 제한되어 있으며, GPT-3와 ChatGPT는 동일한 입력에 대해 자주 다른 출력을 생성하여 평가의 일관성에 영향을 준다.
(b) Generate text from graph: <H> Auburn Washington <R> is Part Of <T> Pierce County Washington <H> Pierce County Washington <R> country <T> United States
(b) Generate text from graph: <H> Auburn Washington <R> is Part Of <T> Pierce County Washington <H> Pierce County Washington <R> country <T> United States

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.