Skip to main content
QUICK REVIEW

[論文レビュー] SKILL: Structured Knowledge Infusion for Large Language Models

Fédor Moiseev, Zhe Dong|arXiv (Cornell University)|May 17, 2022
Topic Modeling被引用数 8
ひとこと要約

本論文は、知識グラフ(KG)の事実的三項対から直接T5言語モデルを事前学習するSKILLという手法を提案する。自然言語の対応付けや文生成を必要とせず、閉形式QAタスクにおいて最先端の性能を達成した。MetaQAではWikiMoviesを用いて正確一致スコアが3倍向上し、FreebaseQA、WikiHop、TriviaQAでも優れた結果を示した。これは、LLMが自然言語の教師なしで構造化された知識から効果的に学習できることを示している。

ABSTRACT

Large language models (LLMs) have demonstrated human-level performance on a vast spectrum of natural language tasks. However, it is largely unexplored whether they can better internalize knowledge from a structured data, such as a knowledge graph, or from text. In this work, we propose a method to infuse structured knowledge into LLMs, by directly training T5 models on factual triples of knowledge graphs (KGs). We show that models pre-trained on Wikidata KG with our method outperform the T5 baselines on FreebaseQA and WikiHop, as well as the Wikidata-answerable subset of TriviaQA and NaturalQuestions. The models pre-trained on factual triples compare competitively with the ones on natural language sentences that contain the same knowledge. Trained on a smaller size KG, WikiMovies, we saw 3x improvement of exact match score on MetaQA task compared to T5 baseline. The proposed method has an advantage that no alignment between the knowledge graph and text corpus is required in curating training data. This makes our method particularly useful when working with industry-scale knowledge graphs.

研究の動機と目的

  • 大規模言語モデル(LLM)が、自然言語の教師なしで構造化された知識グラフ三項対から事実的知識を効果的に学習・内部化できるかどうかを調査すること。
  • 自然言語テキストとの対応付けを必要としない、LLMへの知識統合のスケーラブルな手法を開発すること。
  • 同じ知識を含む自然言語文で学習するのと比較して、三項対で直接学習する方が性能が優れているか、同等であるかどうかを評価すること。
  • モデルサイズとKGサイズが、知識の記憶および推論性能に与える影響を評価すること。
  • 高価なデータキュレーションパイプラインを必要とせず、産業規模の知識グラフをLLMの事前学習に効率的に統合できるようにすること。

提案手法

  • 本手法は、標準的なマスク言語モデル(MLM)の目的関数を用いて、知識グラフの事実的三項対(主語-関係-目的語)から直接T5モデルを事前学習する。
  • 学習データは、エンティティリンクや文生成を必要とせず、'Barack Obama - was born in - Kenya' のようなテキスト文字列としてフォーマットされた、元のKG三項対から構成される。
  • 外部テキストコーパスとの三項対の対応付けや自然言語記述の生成を不要とすることで、データキュレーションの複雑さが低減される。
  • モデルは、リtrieーブ・オーガニゼーションを伴わず、事前学習時に埋め込まれた知識に依存して、下流のQAタスクに対してファインチューニングされる。
  • WikデータやWikiMoviesのような大規模KGに容易にスケーリング可能であり、それらの三項形式を直接利用できる。
  • ハイパーパrameterは全実験で一貫しており、WikiMoviesでは100Kステップ、Wikidataでは200Kステップの学習が実施された。

実験結果

リサーチクエスチョン

  • RQ1T5のような大規模言語モデルは、自然言語の教師なしで、構造化された知識グラフ三項対から事実的知識を直接学習できるか?
  • RQ2同じ知識を含む自然言語文で事前学習されたモデルと比較して、KG三項対で事前学習されたモデルの閉形式QAタスクにおける性能はどのように異なるか?
  • RQ3SKILL事前学習による性能向上は、モデルサイズとKGサイズに比例して拡大するか?
  • RQ4Raw三項対での学習に限定された場合、モデルが知識グラフをどれほど記憶し、推論できるか?
  • RQ5スキーマの対応付けや文生成を必要とせず、産業規模の知識グラフにSKILLを効果的に適用できるか?

主な発見

  • WikiMovies KGを用いたMetaQAベンチマークにおいて、SKILLで事前学習されたT5.1.1-largeモデルは、ベースラインと比較して正確一致スコアが3倍向上(テストセットで71.52)した。
  • Wikidata三項対で事前学習されたSKILLモデルは、FreebaseQA、WikiHop、およびTriviaQAのWikidata回答可能サブセットでT5ベースラインを上回った。
  • 同じ知識を含む対応する自然言語文で学習されたモデルと比較して、三項対で直接学習したモデルは競争力のある性能を示し、三項対による直接学習が有効であることを示した。
  • 性能向上はより大きなモデルで顕著であり、モデルサイズが大きくなるに従い、向上幅が増加した。これは、本手法のスケーラビリティを示している。
  • 1ホップQAタスク(単一の三項で十分)では改善が顕著だったが、2/3ホップタスク(推論を要する)では改善が小さく、グラフ構造の捉えきりの限界を示唆した。
  • C4での追加事前学習により、T5.1.1-baseおよび-largeモデルの性能が向上したが、XXLバージョンでは逆に性能低下が生じた。これは、過学習に関する先行研究の結果と整合的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。