Skip to main content
QUICK REVIEW

[論文レビュー] LLM2KB: Constructing Knowledge Bases using instruction tuned context aware Large Language Models

Anmol Nayak, Hari Prasad Timmapathini|arXiv (Cornell University)|Aug 25, 2023
Topic Modeling被引用数 4
ひとこと要約

本稿では、LoRAを用いたパラメータ効率の良い微調整により、文脈に配慮した大規模言語モデル(Llama-2-13b-chatおよびStableBeluga-13B)を用いて知識ベースを構築するシステム、LLM2KBを提案する。Dense Passage Retrieval(DPR)を用いて取得したWikipediaページの文脈を活用することで、LM-KBC 2023チャレンジの21関係において平均F1スコア0.6185を達成し、最小限のパラメータ更新で効果的な知識ベース構築が可能であることを示した。

ABSTRACT

The advent of Large Language Models (LLM) has revolutionized the field of natural language processing, enabling significant progress in various applications. One key area of interest is the construction of Knowledge Bases (KB) using these powerful models. Knowledge bases serve as repositories of structured information, facilitating information retrieval and inference tasks. Our paper proposes LLM2KB, a system for constructing knowledge bases using large language models, with a focus on the Llama 2 architecture and the Wikipedia dataset. We perform parameter efficient instruction tuning for Llama-2-13b-chat and StableBeluga-13B by training small injection models that have only 0.05 % of the parameters of the base models using the Low Rank Adaptation (LoRA) technique. These injection models have been trained with prompts that are engineered to utilize Wikipedia page contexts of subject entities fetched using a Dense Passage Retrieval (DPR) algorithm, to answer relevant object entities for a given subject entity and relation. Our best performing model achieved an average F1 score of 0.6185 across 21 relations in the LM-KBC challenge held at the ISWC 2023 conference.

研究の動機と目的

  • 大規模言語モデルを用いた、効率的でスケーラブルな知識ベース構築手法の開発。
  • 大規模モデルの微調整にかかる高コストを解消するため、LoRAのようなパラメータ効率の良い技術を採用すること。
  • Dense Passage Retrieval(DPR)を用いた文脈に配慮したリtrievalを統合することで、Wikipediaからの事実知識抽出の精度を向上させること。
  • 特に事実記憶を要する関係に対して、指示微調整済みLLMのオープンドメイン知識ベース構築における性能を評価すること。
  • トレーニングデータ生成戦略およびモデルアーキテクチャが関係抽出性能に与える影響を調査すること。

提案手法

  • Llama-2-13b-chatおよびStableBeluga-13Bを、ベースモデルパラメータの0.05%のみを更新する低ランク適応(LoRA)を用いて微調整した。
  • Dense Passage Retrieval(DPR)を用いて抽出した被験体エンティティのWikipediaページ文脈を組み込んだプロンプト工学戦略により、トレーニングサンプルを生成した。
  • 文脈に配慮したインライン学習を活用し、与えられた被験体および関係に対してオブジェクトエンティティを予測するようLLMを誘導する指示微調整プロンプトを設計した。
  • 2種類のデータ生成手法を用いてモデルを訓練した:1つはトレーニングセットのみを用いたもの、もう1つはトレーニングセットとバリデーションセットの両方を用いたもの。
  • LM-KBC 2023チャレンジのテストセットにおいて、マクロ平均の精度、再現率、F1スコアを用いてモデル性能を評価した。
  • 予測されたオブジェクトエンティティの妥当性を確認するため、Wikidata APIを用いて、幻覚的または存在しないエンティティをフィルタリングした。
Figure 1: LLM2KB System Architecture.
Figure 1: LLM2KB System Architecture.

実験結果

リサーチクエスチョン

  • RQ1LoRAを用いたパラメータ効率の良い微調整により、完全な微調整を伴わずに大規模言語モデルを知識ベース構築に適応させることは可能か?
  • RQ2DPRを用いて取得したWikipediaパラグラフの文脈を統合することで、関係予測の事実的正確性は向上するか?
  • RQ3指示微調整済みのLlama-2-13b-chatとStableBeluga-13Bの間で、オープンドメイン知識ベース構築タスクにおける性能に差は生じるか?
  • RQ4トレーニングのみ vs. トレーニング+バリデーションの両方を用いたデータ生成戦略の違いが、モデルの一般化性能およびF1スコアに与える影響は何か?
  • RQ5「PersonHasNumberOfChildren」や「SeriesHasNumberOfEpisodes」のような関係では、文脈の統合にもかかわらず、なぜ性能が低くなるのか?

主な発見

  • 最も優れた性能を示したモデルは、方法1のデータ生成法を用いて微調整されたLlama-2-13b-chatで、LM-KBC 2023チャレンジの21関係において平均F1スコア0.6185を達成した。
  • 同じデータ生成法を用いて微調整した場合、Llama-2-13b-chatはStableBeluga-13Bを上回る性能を示し、アーキテクチャ的要因または微調整感受性の違いが示唆された。
  • 「PersonHasNoblePrize」関係は最高のF1スコア0.9567を記録した一方、「PersonHasEmployer」は最低の0.2555を記録し、モデルが特定の関係に強くバイアスされていることが示された。
  • 「PersonHasNumberOfChildren」や「SeriesHasNumberOfEpisodes」のように数値回答を要する関係では、性能が著しく低く(F1 < 0.5)なった。これは、モデルが文脈を十分に把握できず、記憶された事実に依存するためである。
  • モデルは幻覚的問題を示し、存在しないが現実味のあるオブジェクトエンティティを生成しており、Wikidata APIによる検証でその不正解が確認された。
  • 推論時のプロンプトのわずかな変更が、顕著な性能低下を引き起こし、プロンプト工学における脆弱性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。