[論文レビュー] Right for Right Reasons: Large Language Models for Verifiable Commonsense Knowledge Graph Question Answering
本稿では、知識グラフの三元組と公理的かつ明示的な形で内在する常識的知識を用いて、すべての推論ステップをグラウンドする、検証可能で常識的知識を有する知識グラフ質問応答フレームワーク $R^{3}$ を提案する。この手法は、既存の LLM ベースの手法と比較して、質問応答、主張検証、好みの一致の各タスクにおいて、幻覚や推論エラーを顕著に低減し、正確性と検証可能性を向上させる。特に、長尾エンティティに対して顕著な改善効果を示す。
Knowledge Graph Question Answering (KGQA) methods seek to answer Natural Language questions using the relational information stored in Knowledge Graphs (KGs). With the recent advancements of Large Language Models (LLMs) and their remarkable reasoning abilities, there is a growing trend to leverage them for KGQA. However, existing methodologies have only focused on answering factual questions, e.g., "In which city was Silvio Berlusconi's first wife born?", leaving questions involving commonsense reasoning that real-world users may pose more often, e.g., "Do I need separate visas to see the Venus of Willendorf and attend the Olympics this summer?" unaddressed. In this work, we first observe that existing LLM-based methods for KGQA struggle with hallucination on such questions, especially on queries targeting long-tail entities (e.g., non-mainstream and recent entities), thus hindering their applicability in real-world applications especially since their reasoning processes are not easily verifiable. In response, we propose Right for Right Reasons (R3), a commonsense KGQA methodology that allows for a verifiable reasoning procedure by axiomatically surfacing intrinsic commonsense knowledge of LLMs and grounding every factual reasoning step on KG triples. Through experimental evaluations across three different tasks--question answering, claim verification, and preference matching--our findings showcase R3 as a superior approach, outperforming existing methodologies and notably reducing instances of hallucination and reasoning errors.
研究の動機と目的
- LLM ベースの知識グラフ質問応答(KGQA)システムにおける検証可能性の欠如、特に常識的推論タスクにおいての課題に対処すること。
- KGQA における長尾または特殊なエンティティを扱う際の LLM における幻覚を低減すること。
- 事実的推論ステップと常識的推論の両方が、明示的な公理化を通じてグラウンドされ、検証可能であることを保証すること。
- 高リスクまたはパーソナライズされたクエリが一般的な実世界の KGQA アプリケーションにおける耐性と信頼性を向上させること。
- 希少なエンティティや最近導入されたエンティティに対しても高いパフォーマンスを維持できるメソドロジーを構築すること。これは、既存の LLM ベースのベースラインに見られる制限を克服する。
提案手法
- すべての事実的推論ステップが関連する KG 三元組にグラウンドされるように、木構造の探索を用いて、トレーサビリティと検証性を確保する。
- LLM に内在する常識的知識を公理的に抽出し、外部の知識源に依存せずに推論をガイドする。
- 事実的推論(KG 三元組にグラウンド)と常識的推論(抽出された公理によってガイド)を明示的に分離することで、検証可能性を保証する。
- すべての事実的前提が KG 三元組によって裏付けられていることを要求することで、幻覚を回避するための慎重かつ厳密なプロンプト戦略を採用する。
- Few-shot デモとタスク固有のプロンプトを用いて、LLM が構造的かつ検証可能な推論チェーンを生成するのをガイドする。
- 推論予算を維持し、有効なパスが見つからない場合には早期に終了させる。これにより、完全性よりも正しさを優先する。
実験結果
リサーチクエスチョン
- RQ1すべての事実的ステップを KG 三元組にグラウンドさせることで、LLM ベースの KGQA システムが常識的推論タスクにおいて検証可能になるか。
- RQ2LLM ベースの KGQA のパフォーマンスは、長尾エンティティにおいてどのように低下するか。また、検証可能な推論によってその低下は緩和可能か。
- RQ3内在する常識的知識を公理的に抽出することで、幻覚の低減と推論の信頼性向上にどの程度寄与するか。
- RQ4$R^{3}$ は、多様な KGQA タスクにおいて、既存の LLM ベースおよび純粋な LLM ベースラインと比較して、正確性、FActScore、推論品質の観点でどのように差をつけるか。
- RQ5エンティティのなじみが薄いようなパーソナライズド KGQA タスク(例:好みの一致)において、$R^{3}$ は高いパフォーマンスを維持できるか。
主な発見
- $R^{3}$ は好みの一致タスクで最高の正確性(57%)を達成し、KAPING(44%)を顕著に上回り、優れたパーソナライゼーション能力を示した。
- 主張検証タスクにおいて、$R^{3}$ はオリジナル設定および長尾設定の両方で高い FActScore(0.98)を維持した。一方、ベースラインは長尾条件下で FActScore が著しく低下した。
- 長尾設定では、$R^{3}$ がオリジナルの正確性の98%を維持した。これに対して、2-shot CoT は0.51ポイント低下した。これは、エンティティの不顕著さに対して高い耐性を示している。
- $R^{3}$ は全手法の中で最高の推論スコア(0.04)を達成し、few-shot CoT よりも優れた信頼性の高い推論チェーンを生成した。
- すべての事実的ステップを KG 三元組にグラウンドし、常識的公理を明示的に抽出することで、幻覚と推論エラーを低減し、より信頼できる出力を得た。
- 慎重なアプローチを採用しているにもかかわらず、$R^{3}$ は最小限の幻覚で高いパフォーマンスを達成しており、検証可能性と正しさを優先しても正確性が損なわれないことを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。