Skip to main content
QUICK REVIEW

[論文レビュー] TRAM: Benchmarking Temporal Reasoning for Large Language Models

Yuqing Wang, Yun Zhao|arXiv (Cornell University)|Oct 2, 2023
Topic Modeling被引用数 4
ひとこと要約

TRAMは、期間、頻度、算術、因果関係、時間的関係をカバーする10の時間的推論タスクからなる包括的なベンチマークであり、多様なソースから抽出された526.1万個の選択肢付きの質問を含む。GPT-4 や Llama2 といった大規模言語モデル(LLM)を評価した結果、最新のモデルですら人間のパフォーマンスに達していないことが判明し、GPT-4 は平均87.8%の正答率を示した。これは、時間的ヒントの暗黙的理解に依然として課題が残っていることを示している。

ABSTRACT

Reasoning about time is essential for understanding the nuances of events described in natural language. Previous research on this topic has been limited in scope, characterized by a lack of standardized benchmarks that would allow for consistent evaluations across different studies. In this paper, we introduce TRAM, a temporal reasoning benchmark composed of ten datasets, encompassing various temporal aspects of events such as order, arithmetic, frequency, and duration, designed to facilitate a comprehensive evaluation of the TeR capabilities of large language models (LLMs). We evaluate popular LLMs like GPT-4 and Llama2 in zero-shot and few-shot scenarios, and establish baselines with BERT-based and domain-specific models. Our findings indicate that the best-performing model lags significantly behind human performance. It is our aspiration that TRAM will spur further progress in enhancing the TeR capabilities of LLMs.

研究の動機と目的

  • 大規模言語モデル(LLM)における時間的推論を評価するための統一的で標準化されたベンチマークが不足しているという問題に対処すること。
  • 期間、頻度、算術、因果関係、時間的関係を含む、基礎的および高度な時間的推論能力を包括的に評価すること。
  • さまざまなLLMアーキテクチャやプロンプティング戦略(ゼロショット、フェイシング、チェーン・オブ・トゥークン)に対応できる一貫した評価を可能にするベンチマークを確立すること。
  • 現在のLLMに残存する限界、特に暗黙の時間的ヒントや洗練された時間的物語の解釈における課題を特定すること。

提案手法

  • TRAMは、既存のデータセット、人間が作成したテンプレート、Webソース、およびプログラム生成から得られた10の異なる時間的推論タスクを統合している。
  • 各タスクは、LLMの標準的でゼロショット評価が可能な選択肢付きの質問として構造化されている。
  • 質問は多様なソースから抽出されている:時間的関係にはTimeBankおよびTempEval-3、時間的NLIにはSNLI/MNLI、因果関係にはCOPAを模倣したタスク、物語作成にはROCStories/SCTを用いている。
  • 専門家によるアノテーションとプログラム生成を用いて答えを生成し、高品質で一貫性のあるラベル付けを実現している。
  • ベンチマークには38のサブタスクと526.1万個の質問が含まれており、さまざまな文脈における明示的および暗黙の時間的表現をカバーしている。
  • モデルはゼロショット、フェイシング、チェーン・オブ・トゥークンのプロンプティングを用いて評価され、限定データ上で微調整されたBERTスタイルのモデルも含まれる。

実験結果

リサーチクエスチョン

  • RQ1現在の大規模言語モデルは、統一的かつ包括的な時間的推論タスクのベンチマークでどの程度のパフォーマンスを示すのか?
  • RQ2GPT-4 や Llama2、PaLM2 などの異なるLLMアーキテクチャは、時間的期間、頻度、算術的推論においてそれぞれどのような強みと弱みを示すのか?
  • RQ3LLMは、因果関係や文脈依存の時間的参照といった暗黙の時間的ヒントをどの程度困難に感じているのか?
  • RQ4チェーン・オブ・トゥークンプロンプティングは、標準的なプロンプティングに比べて、複雑な時間的推論タスクにおけるパフォーマンスにどのように影響するのか?
  • RQ5最先端のLLMは、時間的推論において人間水準のパフォーマンスからどの程度かけ離れているのか?

主な発見

  • GPT-4はTRAMタスク全体で最高の平均正答率87.8%を達成し、他のLLMおよびBERTベースのモデルを上回った。
  • 強力なパフォーマンスを示したが、依然として人間のパフォーマンスから約10%の差があり、改善の余地が大きいことが示された。
  • モデルは、時間的因果関係や洗練された出来事の順序付けといった暗黙の時間的ヒントに対して、一貫して困難を感じており、高水準のモデルですら同様の課題を抱えている。
  • タスクタイプごとにパフォーマンスの差が見られ、算術および因果関係タスクが特に挑戦的であることが判明した。
  • 手動による誤り分析から、ヒントが暗黙的または文脈依存である場合、モデルが時間的関係を誤って解釈することが頻発することが明らかになった。
  • ベンチマークから、現在のLLMは時間的物語や出来事に基づく推論において、実世界的かつ文脈豊かな状況において、十分な理解を欠いていることが露呈された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。