[論文レビュー] Large Language Models Can Learn Temporal Reasoning
本稿では、自然言語を構造的な時系列グラフに変換し、Chain-of-Thoughtのブートストラップとデータ拡張を用いた記号的推論を適用することで、大規模言語モデル(LLMs)の時系列推論性能を向上させる、新しいフレームワークであるTempGraph-LLMを提案する。この手法は、時系列QAベンチマークで最先端の性能を達成し、Llama2-13Bを用いて79.5%の正確一致スコアを達成した。これは、グラフ構造の推論と記号的統合が、自由なテキスト推論に比べて正確性と一貫性を顕著に向上させることを示している。
While large language models (LLMs) have demonstrated remarkable reasoning capabilities, they are not without their flaws and inaccuracies. Recent studies have introduced various methods to mitigate these limitations. Temporal reasoning (TR), in particular, presents a significant challenge for LLMs due to its reliance on diverse temporal concepts and intricate temporal logic. In this paper, we propose TG-LLM, a novel framework towards language-based TR. Instead of reasoning over the original context, we adopt a latent representation, temporal graph (TG) that enhances the learning of TR. A synthetic dataset (TGQA), which is fully controllable and requires minimal supervision, is constructed for fine-tuning LLMs on this text-to-TG translation task. We confirmed in experiments that the capability of TG translation learned on our dataset can be transferred to other TR tasks and benchmarks. On top of that, we teach LLM to perform deliberate reasoning over the TGs via Chain-of-Thought (CoT) bootstrapping and graph data augmentation. We observed that those strategies, which maintain a balance between usefulness and diversity, bring more reliable CoTs and final results than the vanilla CoT distillation.
研究の動機と目的
- 時刻、論理、日常的常識の統合的知識を必要とする、既存のLLMsが信頼できる時系列推論を実行する能力に限界があることに対処すること。
- 自由なテキスト推論のChain-of-Thoughtプロンプトを超える、構造的な時系列グラフを通じた時系列関係の明示的モデル化により、推論の正確性を向上させること。
- テキストから時系列グラフへのアライメントのための、完全に制御可能で最小限の監視を要する合成データセットを構築すること。
- ブートストラップされた推論ステップとデータ拡張を用いて、記号的推論をLLMsに統合し、複雑な時系列タスクにおける信頼性とパフォーマンスを向上させること。
提案手法
- フレームワークはまず、ルールベースのパイプラインを用いて自然言語の物語を時系列グラフに変換し、イベントを時系列関係(開始/終了時刻、期間、順序)で結ぶ。
- テンプレートをYAGO11kに適用して、高制御性と最小限の監視で、(物語, 時系列グラフ, 問題, 回答)のアラインドサンプルを生成する、合成データセット「TempGraph QA」を構築する。
- この合成データセットでモデルを事前学習させることで、時系列グラフ抽出の性能を向上させ、下流タスクへの転移を可能にする。
- 記号的推論はChain-of-Thoughtのブートストラップにより誘導され、教師あり微調整のための信頼性の高い中間推論ステップを生成する。
- 神経記号的推論タスクにおけるデータ不足を緩和するための2つのデータ拡張戦略を導入する。
- 推論中に数学的および日常的常識の外部知識を統合して、推論能力を強化する。

実験結果
リサーチクエスチョン
- RQ1最小限の監視で、大規模言語モデルが自然言語テキストから構造的な時系列グラフを効果的に抽出できるか。
- RQ2自由なテキスト推論のChain-of-Thoughtプロンプトと比較して、構造的な中間ステップを用いた記号的推論は、LLMsの時系列推論における信頼性と正確性を向上させるか。
- RQ3完全に制御可能な合成時系列QAデータセットで事前学習することで、下流の時系列推論タスクにおけるゼロショットまたはフェイントショット性能がどの程度向上するか。
- RQ4データ拡張と外部知識統合は、複雑な神経記号的推論タスクにおけるLLMsのパフォーマンスにどのように影響を与えるか。
- RQ5グラフベースの神経記号的フレームワークは、多様な時系列推論ベンチマークで一般化可能であり、標準的なプロンプトおよび微調整手法を上回る性能を発揮できるか。
主な発見
- TempGraph-LLMフレームワークは、Llama2-13Bを用いてTempGraph QAベンチマークで79.5%の正確一致スコアを達成し、ベースラインの微調整モデルを14.9ポイント上回った。
- ブートストラップされたChain-of-Thoughtステップを用いた記号的推論を組み込むことで、自由なテキストCoTに比べて5.9ポイントの性能向上が得られ、一貫性と信頼性の向上が確認された。
- データ拡張を記号的推論と組み合わせると、性能が4.0ポイント向上(75.3%から79.7% EM)し、低データ環境下での重要性が浮き彫りになった。
- 合成されたTempGraph QAデータセットで事前学習することで、他のタスクへの転移が良好に機能し、時系列グラフ学習が訓練分布を超えて一般化することを示した。
- 外部知識(数学的および日常的常識)を統合することで、記号的推論と組み合わせた場合、パフォーマンスが2.1ポイント向上(75.3%から77.6% EM)した。
- アブレーションスタディにより、時系列グラフ表現と記号的推論の両方が重要であることが確認された。両者を削除すると、性能が著しく低下した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。