[論文レビュー] Chain-of-Knowledge: Integrating Knowledge Reasoning into Large Language Models by Learning from Knowledge Graphs
本論文は、知識グラフ(KGs)から学習することで、大規模言語モデル(LLMs)の知識推論能力を向上させるフレームワーク「Chain-of-Knowledge(CoK)」を提案する。知的推論のための体系的で洗練されたデータセットKnowReasonを、ルール抽出と自然言語変換によって生成し、ルールの過適合を軽減するための試行錯誤メカニズムを導入することで、知識推論および一般推論ベンチマーク、特にOOD一般化と常識的推論タスクにおけるLLMの性能が顕著に向上した。
Large Language Models (LLMs) have exhibited impressive proficiency in various natural language processing (NLP) tasks, which involve increasingly complex reasoning. Knowledge reasoning, a primary type of reasoning, aims at deriving new knowledge from existing one.While it has been widely studied in the context of knowledge graphs (KGs), knowledge reasoning in LLMs remains underexplored. In this paper, we introduce Chain-of-Knowledge, a comprehensive framework for knowledge reasoning, including methodologies for both dataset construction and model learning. For dataset construction, we create KnowReason via rule mining on KGs. For model learning, we observe rule overfitting induced by naive training. Hence, we enhance CoK with a trial-and-error mechanism that simulates the human process of internal knowledge exploration. We conduct extensive experiments with KnowReason. Our results show the effectiveness of CoK in refining LLMs in not only knowledge reasoning, but also general reasoning benchmarkms.
研究の動機と目的
- 複雑な推論タスクにおいて極めて重要であるが、まだ十分に検討されていない知識推論を大規模言語モデル(LLMs)に統合すること。
- 知識グラフから合成的ルールを抽出し、それを自然言語サンプルに変換することで、高品質で多様なデータセットKnowReasonを構築すること。
- 知識推論の学習過程におけるルールの過適合と幻覚を克服し、未知のルールへの一般化を制限する要因を軽減すること。
- 分布外(OOD)推論タスクにおけるLLMの一般化性能を向上させるとともに、知識推論を越えて、常識的推論や記号的推論などの他の推論ベンチマークへの汎用性を高めること。
提案手法
- 三段階パイプラインによるデータセット構築:(1) 知識グラフからのルール抽出により、合成的関係パターンを抽出;(2) 抽出されたルールに一致する関連する三項対を特定する知識選択;(3) 三項対を自然言語の推論例に変換するサンプル生成。
- 行動クラーニングを用いたモデル学習により、LLMsをKnowReasonデータセット上で微調整し、推論チェーンを模倣できるようにする。
- CoK(T&E)に導入された試行錯誤メカニズムは、人間の内部的知識探索に類似したプロセスをシミュレートし、特定のルールへの過剰依存を軽減し、モデルの耐性を向上させる。
- 匿名化設定と通常設定の両方を評価に用いる:匿名化設定はデータ漏洩を防ぐために、通常設定は実際のエンティティを用いた実世界の適用性をテストするために使用。
- CoKフレームワークを、常識的推論(CSQA)、BBH、ARCなどの下流推論タスクに適用し、汎用性を評価。
- 知識プロービングを実装し、通常設定におけるモデル固有のデータを保証するとともに、評価時のデータ漏洩を防止。
実験結果
リサーチクエスチョン
- RQ1知識グラフからの構造的知識を活用することで、LLMsに知識推論を効果的に統合できるか?
- RQ2ルールの過適合はLLMsの知識推論性能にどのように影響するか?また、人間の学習メカニズムを模倣した手法によってこれを軽減できるか?
- RQ3CoKフレームワークは、分布外(OOD)推論タスクにおける一般化性能をどの程度向上させるか?
- RQ4CoKフレームワークは、知識推論を越えて、常識的推論や記号的推論などの多様な推論ベンチマークでも性能向上をもたらすか?
主な発見
- 匿名化設定では、CoK(T&E)がOODデータセットで22.22%の正答率を達成し、ヴァニラCoT(0.00%)およびICL-CoK(6.20%)を上回り、一般化性能の向上を示した。
- 通常設定でも、CoK(T&E)はOODデータセットで22.22%の正答率を達成し、実世界のエンティティデータに対して高い耐性を示し、ルール依存性が低下した。
- 常識的推論ベンチマークでは、Mistral-7b + CoK(T&E)がCSQAの正答率を66.5%から68.1%へ、BBHを53.2%から54.7%へ、ARC-eを81.2%から82.3%へ向上させ、優れた汎用性を示した。
- 誤差分析の結果、OOD設定では主に誤った推論経路が原因でエラーが発生しており、幻覚による誤りは少なかった。これは、一般化において経路選択の重要性を示している。
- CoK(T&E)に組み込まれた試行錯誤メカニズムにより、ルールの過適合が顕著に軽減された。OOD性能の向上とエンティティ選択時の幻覚率の低下がその証左となった。
- ルール抽出と自然言語変換により構築されたKnowReasonデータセットは、LLMsにおける知識推論の有効な訓練と評価を可能にし、多様で現実的な推論チェーンを提供している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。