Skip to main content
QUICK REVIEW

[論文レビュー] DyKnow: Dynamically Verifying Time-Sensitive Factual Knowledge in LLMs

Seyed Mahed Mousavi, Simone Alghisi|arXiv (Cornell University)|Apr 10, 2024
Topic Modeling被引用数 4
ひとこと要約

本稿では、リアルタイムでのWikidataクエリを用いて、大規模言語モデル(LLM)における時限的事実知識の古さを検出する動的ベンチマークDyKnowを紹介する。この研究により、GPT-J や Llama-2 を含む大多数のモデルが、古くなった事実を保持していることが明らかになった。知識編集手法とリtrieval-Augmented Generation(RAG)の効果を評価した結果、RAGは整合性の観点で編集手法を上回ったが、モデルの重みを修正しないのに対し、編集手法はスケーラビリティに限界があり、モデル依存性が強いことが判明した。

ABSTRACT

LLMs acquire knowledge from massive data snapshots collected at different timestamps. Their knowledge is then commonly evaluated using static benchmarks. However, factual knowledge is generally subject to time-sensitive changes, and static benchmarks cannot address those cases. We present an approach to dynamically evaluate the knowledge in LLMs and their time-sensitiveness against Wikidata, a publicly available up-to-date knowledge graph. We evaluate the time-sensitive knowledge in twenty-four private and open-source LLMs, as well as the effectiveness of four editing methods in updating the outdated facts. Our results show that 1) outdatedness is a critical problem across state-of-the-art LLMs; 2) LLMs output inconsistent answers when prompted with slight variations of the question prompt; and 3) the performance of the state-of-the-art knowledge editing algorithms is very limited, as they can not reduce the cases of outdatedness and output inconsistency.

研究の動機と目的

  • LLMにおける時限的事実知識の古さを特定するという重要なギャップを解消すること、特に古くなった事実の「何が」で「いつ」であるかを特定すること。
  • 評価時に最新の答えをWikidataからリアルタイムで取得することで、古くなりにくい動的ベンチマークを構築すること。
  • 知識編集手法とRAGを、LLMの現在の事実知識に整合させる代替手法として、その有効性を評価すること。
  • LLMの事実応答を分析することで、トレーニングデータの収集時期を推定すること。
  • 共有されたコード、データセット、評価スクリプトを通じて、コミュニティによるベンチマークの新分野への拡張を可能にすること。

提案手法

  • DyKnowは評価時にリアルタイムでWikidataから最新の事実的答えを取得し、固有の識別子とプロパティを用いて各事実の時刻付き応答を抽出する。
  • ベンチマークは政治(47カ国)、スポーツ(28人のアスリート)、組織(23人のCEO/事務総長)の時限的事実を対象とし、モデル評価用に語彙化されたプロンプトを用いる。
  • モデルの応答とリアルタイムでのWikidataの答えを比較することで、古くなった知識を特定し、正確一致とドメイン間の調和平均を用いて性能を測定する。
  • 知識編集手法(ROME, MEMIT, SERAC, IKE)を4つの選択されたLLMに適用し、同じベンチマークで性能を評価する。
  • リtrieval-Augmented Generation(RAG)を、現在の事実知識にLLMを整合させる代替手法として用い、最新の事実を取得し、モデルに更新された応答を生成させるプロンプトを提示する。
  • GPT-2 XL や Llama-2 Chat などのモデルで、編集数を増やしながら編集手法のスケーラビリティを評価し、性能低下を測定する。

実験結果

リサーチクエスチョン

  • RQ1LLMに内蔵された時限的事実知識のうち、どれくらいの割合が古く、そのトレーニング/ファインチューニングに使われたデータはいつ収集されたのか?
  • RQ2最先端の知識編集手法は、LLMにおける現実世界の時限的事実を修正するためにどれほど効果的か?
  • RQ3RAGは、LLMの現在の事実知識に整合させるために、知識編集の代替として信頼できるか?
  • RQ4異なるLLMアーキテクチャにおいて、編集数の増加に伴い編集手法の性能はどのように変化するか?
  • RQ5現在の編集手法とリtrieバルベースの整合化手法には、LLMの知識を最新の状態に保つためにどのような制限があるか?

主な発見

  • Cristiano Ronaldoのクラブ歴に関する質問に対して、GPT-J、Llama-2、Falcon、Bloomは古くなった応答を返した。GPT-Jは2021年にリリースされたにもかかわらず、誤って「レアル・マドリード」と回答した。
  • GPT-3 や Vicuna はリリース時においては正しく応答していたが、時間経過とともに古くなった応答を返すようになり、リリース後の知識の劣化(knowledge decay)が生じたことが示された。
  • ROMEとSERACは編集数の増加に伴い性能が低下したため、大規模な知識更新にはスケーラビリティに限界があることが示された。
  • IKEはGPT-JとMistral Instructにおいて高い性能を示したが、これはイン・コンテキスト学習が特定のモデルに対しては有効である可能性を示唆しているが、すべての古くなった事実を修正できなかった。
  • RAGはMistral Instructで80%以上の整合性性能を達成し、一部のモデルでは編集手法を上回ったが、モデルの内部知識を修正しない。
  • MEMITはLlama-2 Chatにおいて、さまざまな編集回数でも安定した性能を示したが、ROMEとSERACは編集数の増加に伴い性能が低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。