Skip to main content
QUICK REVIEW

[論文レビュー] Evaluating Generative Models for Graph-to-Text Generation

Shuzhou Yuan, Michael Färber|arXiv (Cornell University)|Jul 27, 2023
Topic ModelingComputer Science被引用数 3
ひとこと要約

本稿は、GPT-3およびChatGPTを用いたゼロショットグラフtoテキスト生成を、AGENDAおよびWebNLGデータセットで評価し、T5 や BART などの微調整済みモデルと比較する。BLEU スコアがそれぞれ 10.57 および 11.08 に達するなど、流暢なテキストを生成するが、意味的関係の理解に失敗し、幻覚を生じる。一方、生成テキストで微調整した BERT は、機械生成テキストと人間生成テキストを区別する際、マクロ-F1 が 95% を超える。

ABSTRACT

Large language models (LLMs) have been widely employed for graph-to-text generation tasks. However, the process of finetuning LLMs requires significant training resources and annotation work. In this paper, we explore the capability of generative models to generate descriptive text from graph data in a zero-shot setting. Specifically, we evaluate GPT-3 and ChatGPT on two graph-to-text datasets and compare their performance with that of finetuned LLM models such as T5 and BART. Our results demonstrate that generative models are capable of generating fluent and coherent text, achieving BLEU scores of 10.57 and 11.08 for the AGENDA and WebNLG datasets, respectively. However, our error analysis reveals that generative models still struggle with understanding the semantic relations between entities, and they also tend to generate text with hallucinations or irrelevant information. As a part of error analysis, we utilize BERT to detect machine-generated text and achieve high macro-F1 scores. We have made the text generated by generative models publicly available.

研究の動機と目的

  • GPT-3 や ChatGPT といった生成モデルの、構造化されたグラフデータから記述的テキストを生成するゼロショット能力を評価すること。
  • T5 や BART などの微調整済みシーケンスtoシーケンスモデルと比較して、標準的なグラフtoテキストベンチマーク上でのこれらの生成モデルの性能を評価すること。
  • 生成テキストにおける失敗モード、特に意味的関係の理解と幻覚に関する分析を行うこと。
  • 二値分類のための微調整済み BERT を用いて、機械生成テキストの検出可能性を調査すること。
  • 今後の信頼性のある AI や機械生成テキスト分析に関する研究を支援するため、公開可能な生成テキストを提供すること。

提案手法

  • 線形化されたグラフ表現を GPT-3 および ChatGPT の入力プロンプトとして使用し、構造化された知識を自然言語のシーケンスに変換する。
  • 指示テンプレートを用いてモデルにグラフ三項集合からテキストを生成するようプロンプトし、微調整なしにゼロショット推論を可能にする。
  • AGENDA および WebNLG のテストセットを用いて、BLEU、METEOR、ROUGE といった標準指標で性能を評価する。
  • 生成出力と参照テキストを比較することで誤り分析を実施し、幻覚や関係理解の失敗を同定する。
  • 人間が書いたテキストと機械が生成したテキストのペアを用いて BERT モデルを微調整し、テキストの出所を分類する分類器として評価する。マクロ-F1 スコアを用いる。
  • すべての生成テキストは GitHub を介して公開され、再現性およびモデル生成コンテンツの今後の分析を支援する。
(a) Generate paper abstract from title, entities and graph: <title> Significance-aware Hammerstein group models for nonlinear acoustic echo cancellation. <entities> non-linear preprocessor echo path hammerstein model <graph> <H> non-linear preprocessor <R> USED-FOR <T> echo path <H> preprocessor <R>
(a) Generate paper abstract from title, entities and graph: <title> Significance-aware Hammerstein group models for nonlinear acoustic echo cancellation. <entities> non-linear preprocessor echo path hammerstein model <graph> <H> non-linear preprocessor <R> USED-FOR <T> echo path <H> preprocessor <R>

実験結果

リサーチクエスチョン

  • RQ1GPT-3 および ChatGPT は、構造化されたグラフデータからゼロショット設定で流暢で整合性のあるテキストを生成できるか?
  • RQ2生成モデルの性能指標(BLEU、METEOR、ROUGE)は、T5 や BART などの微調整済みモデルと比べてどうか?
  • RQ3生成モデルは、特に意味的関係や事実の整合性に関して、グラフからのテキスト生成時にどのような誤りを頻繁に犯すか?
  • RQ4微調整済み BERT 分類器を用いて、機械生成テキストを人間生成テキストからどの程度まで区別できるか?
  • RQ5GPT-3 および ChatGPT の出力は、同じ入力グラフに対して再現可能か?

主な発見

  • GPT-3 および ChatGPT は、それぞれ AGENDA および WebNLG データセットで BLEU スコア 10.57 および 11.08 を達成し、流暢ではあるが低品質なテキスト生成であることを示している。
  • 生成モデルは、'USED-FOR' や 'PART-OF' のようなエンティティ間の意味的関係を理解できず、事実誤認を引き起こすことがある。
  • ChatGPT は、重複した内容や幻覚を含む生成をし、例として「Abner W. Sibal は、大きな挑戦に直面した著名な人物であった」といった主観的主張を含む。
  • GPT-3 は、名前を誤って出来事と認識し、例として「Abner W. Sibal」を戦闘と誤認するなど、事実の幻覚を示している。
  • 微調整済み BERT モデルは、統合データセットでマクロ-F1 スコア 95.82 を達成し、機械生成テキストの検出が非常に高い精度で可能であることを示している。
  • 結果は、GPT-3 や ChatGPT が同じ入力に対してしばしば異なる出力を生成するため、再現性が低いという点で制限を受けており、評価の一貫性に影響を及ぼしている。
(b) Generate text from graph: <H> Auburn Washington <R> is Part Of <T> Pierce County Washington <H> Pierce County Washington <R> country <T> United States
(b) Generate text from graph: <H> Auburn Washington <R> is Part Of <T> Pierce County Washington <H> Pierce County Washington <R> country <T> United States

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。