Skip to main content
QUICK REVIEW

[論文レビュー] Infusing Knowledge into Large Language Models with Contextual Prompts

Kinshuk Vasisht, Balaji Ganesan|arXiv (Cornell University)|Mar 3, 2024
Topic Modeling被引用数 4
ひとこと要約

本論文では、構造化された知識グラフに依存せずに、ドメイン固有のコーパスから文脈的なプロンプトを生成することによって、大規模言語モデル(LLMs)に知識を注入する手法を提案する。入力プロンプトにエンティティベースの検索によって取得された関連する文脈文を追加したプロンプトで微調整することで、顕著な性能向上が達成された—例として、TACREDではHits@1が0.827、KELM-TEKGENでは0.805を記録—、低リソースまたは代表されていないエンティティに対しても、有効な知識注入が可能であることが示された。

ABSTRACT

Knowledge infusion is a promising method for enhancing Large Language Models for domain-specific NLP tasks rather than pre-training models over large data from scratch. These augmented LLMs typically depend on additional pre-training or knowledge prompts from an existing knowledge graph, which is impractical in many applications. In contrast, knowledge infusion directly from relevant documents is more generalisable and alleviates the need for structured knowledge graphs while also being useful for entities that are usually not found in any knowledge graph. With this motivation, we propose a simple yet generalisable approach for knowledge infusion by generating prompts from the context in the input text. Our experiments show the effectiveness of our approach which we evaluate by probing the fine-tuned LLMs.

研究の動機と目的

  • 実世界のNLP応用において、ドメイン固有または低リソースのエンティティに対して構造化された知識グラフを維持することは現実的ではないという問題に対処すること。
  • 事前に用意された知識ベースやエンティティ埋め込みに依存する既存の知識注入技術の制限を克服すること。
  • 知識グラフに十分に表現されていない、稀なまたはドメイン固有の個々のエンティティに対しても、効果的な知識注入を可能にすること。
  • 構造化されていないテキストコーパスと微調整のみを用いて、スケーラブルで一般化可能かつ効率的な知識注入手法を開発すること。
  • 文脈の長さと質が、関係予測やオープンドメインQAのような知識集約的NLPタスクに与える影響を評価すること。

提案手法

  • 入力プロンプトに言及されるエンティティに基づいて、検索インデックスを用いてドメイン固有コーパスから関連する文脈文を取得する。
  • 関係するエンティティを記述する取得済み文を入力プロンプトに追加することで、文脈的なプロンプトを生成する。
  • 取得した文脈から得た知識を注入するために、事前学習済みLLM(例:Flan-T5)を拡張されたプロンプトで微調整する。
  • 構造化された知識グラフが利用可能な場合、エンティティリンクと分類を用いて文脈の取得精度を向上させる。
  • 表形式データやグラフなど、他のモダリティへもこの手法を拡張し、より広範な適用可能性を実現する。
  • 標準的な指標を用いて、関係予測やオープンドメインQAのような知識集約的タスクでの性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1構造化されていないドメインコーパスから得た文脈的プロンプトは、構造化された知識グラフに依存せずに、LLMsに知識を効果的に注入できるか?
  • RQ2取得した文脈の長さと質は、下流タスクにおける知識注入LLMsの性能にどのように影響するか?
  • RQ3本手法は、事実の三項組やソフトプロンプトを用いる既存の知識注入技術を上回るか?
  • RQ4本手法は、知識ベースに存在しない低リソースまたは代表されていないエンティティにも一般化可能か?
  • RQ5知識グラフが希薄または不完全である実世界のドメイン(例:法的文書)において、本手法はどの程度有効か?

主な発見

  • 文脈的プロンプトを用いて微調整した結果、TACREDデータセットではHits@1が0.827に達し、ベースモデルの0.050と比べて顕著な向上を示した。
  • KELM-TEKGENデータセットでは、文脈的プロンプトを用いたモデルがHits@1で0.805を記録したのに対し、ベースの微調整モデルでは0.056にとどまった。
  • 文脈の長さを延ばすことで性能が向上し、TACREDでは文脈を長くすることでHits@1が0.846から0.914に上昇した。これは、文脈の質が知識へのアクセスを向上させることを示している。
  • トリビアQAの質問応答タスクにおいて、文脈的プロンプトを用いた場合の正確一致スコアは20.0%に達し、ベースモデル(16.7%)と微調整のみのモデル(20.0%)を上回った。
  • 法的ドメインの設定では、Hits@10が0.245から0.290に、MRRが0.200から0.217に向上し、知識が乏しく、グラフが不完全な環境でも有効であることが示された。
  • 知識グラフが不完全または利用不可の状況でも本手法は頑健であることが確認され、Wikidataや類似リポジトリに存在しないエンティティに対しても効果的であることが実証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。