Skip to main content
QUICK REVIEW

[論文レビュー] Using Large Language Models for Zero-Shot Natural Language Generation from Knowledge Graphs

Agnes Axelsson, Gabriel Skantze|arXiv (Cornell University)|Jul 14, 2023
Topic Modeling被引用数 6
ひとこと要約

この論文は、微調整を施さずに、大規模言語モデル(LLMs)、特にOpenAIのChatGPTを用いて、ゼロショットでの知識グラフ(KG)からテキストへの生成を評価している。WebNLG 2020の一部のメトリクスにおいてChatGPTは準最先端の性能を達成しているが、三項の事実性に応じて性能が著しく変動する。具体的には、事実的な三項では最も良く、反事実的な三項では次に良く、架空の三項では最も悪い性能を示す。これは、モデルの事前学習知識と生成品質との強い関連性を示している。

ABSTRACT

In any system that uses structured knowledge graph (KG) data as its underlying knowledge representation, KG-to-text generation is a useful tool for turning parts of the graph data into text that can be understood by humans. Recent work has shown that models that make use of pretraining on large amounts of text data can perform well on the KG-to-text task even with relatively small sets of training data on the specific graph-to-text task. In this paper, we build on this concept by using large language models to perform zero-shot generation based on nothing but the model's understanding of the triple structure from what it can read. We show that ChatGPT achieves near state-of-the-art performance on some measures of the WebNLG 2020 challenge, but falls behind on others. Additionally, we compare factual, counter-factual and fictional statements, and show that there is a significant connection between what the LLM already knows about the data it is parsing and the quality of the output text.

研究の動機と目的

  • 微調整を施さずに大規模言語モデル(LLMs)を用いたゼロショットKGからテキストへの生成の可能性を調査すること。
  • 知識グラフの三項の事実性(事実的、反事実的、架空の)がLLMの生成品質に与える影響を評価すること。
  • LLMが生成するテキストの文法的整合性、三項カバレッジ、および幻覚的生成の頻度を評価すること。
  • LLMの事前学習知識が、任意のKG情報の正確な表現を促進するか、妨げるかを特定すること。
  • 構造化データからのオープンドメイン・ゼロショット自然言語生成(NLG)におけるLLMの限界と可能性についての知見を提供すること。

提案手法

  • 微調整なしで、OpenAIのGPT-3.5-turbo(ChatGPT)を用いて、知識グラフの三項からゼロショットでテキストを生成する。
  • 三項を自然言語のプロンプト形式で提示し、LLMの三項構造の理解力と事前学習内容に依存する。
  • WebNLG 2020ベンチマークと、事実的・反事実的・架空の三項を含む新規に収集したWikiDataベースのデータセットで性能を評価する。
  • Mechanical Turkを用いた人間によるアノテーションにより、文法的整合性、三項カバレッジ、幻覚的生成頻度を評価する。
  • 自動メトリクスと手動での判断を用いて、モデル出力と参照テキストとの間の事実性の一貫性を比較評価する。
  • プロンプト設計のアブレーションスタディを実施し、さまざまな種類の知識グラフの文に応じたモデルの挙動を評価する。
Figure 1: An example graph with three edges representing factual claims about its root entity. Fictional and counterfactual substitutions are listed as the second (in italics) and third (plain) row, respectively, of each entity (box).
Figure 1: An example graph with three edges representing factual claims about its root entity. Fictional and counterfactual substitutions are listed as the second (in italics) and third (plain) row, respectively, of each entity (box).

実験結果

リサーチクエスチョン

  • RQ1LLMのゼロショットKGからテキストへの生成性能は、WebNLG 2020ベンチマークにおいて、最先端の微調整済みモデルと比較してどの程度か?
  • RQ2KGの三項の事実性(事実的、反事実的、架空の)が、LLMが生成するテキストの文法的品質と整合性にどのように影響するか?
  • RQ3LLMは入力の三項をどの程度すべてカバーして生成するか?また、三項の種別によってそのカバレッジはどのように変化するか?
  • RQ4LLMはどの程度頻繁に幻覚的コンテンツ(入力の三項に存在しない事実)を生成するか?また、これは三項の事実性に応じて変化するか?
  • RQ5LLMの事前学習知識と、KGデータを正確に表現する能力との関係は何か?

主な発見

  • ChatGPTは、WebNLG 2020チャレンジの一部の自動メトリクスにおいて準最先端の性能を達成しており、強力なゼロショット一般化能力を示している。
  • 三項の種別に応じて性能に顕著な差が生じる:事実的三項では最も高い正確性、反事実的三項では次に高く、架空の三項ではカバレッジが最低で幻覚的生成率が最も高い。
  • LLMの事前学習知識と生成テキストの品質との間に強い相関関係が認められ、特に事実的文の生成において顕著である。
  • 反事実的および架空の三項では幻覚的生成率が高くなるため、LLMは入力が自身の世界知識と矛盾する場合にテキスト生成に苦労することが示唆される。
  • 架空の文の三項カバレッジは最低であり、LLMが指示に従ってテキストを生成できていない可能性を示している。
  • 本研究では、プロンプト設計が性能に顕著に影響することが判明したが、最適なプロンプトは特定できず、モデルの挙動は入力の種別と事実性の一貫性に敏感であることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。