[论文解读] TRAM: Benchmarking Temporal Reasoning for Large Language Models
TRAM 是一个涵盖 10 项时间推理任务的综合性基准,涵盖持续时间、频率、算术、因果关系和时间关系,包含从多样化来源生成的 526.1 万个多项选择题。在 GPT-4 和 Llama2 等大语言模型上进行评估后发现,即使是最先进的模型也未能达到人类水平的表现,GPT-4 的平均准确率为 87.8%,凸显了在理解隐含时间线索方面仍存在的持久挑战。
Reasoning about time is essential for understanding the nuances of events described in natural language. Previous research on this topic has been limited in scope, characterized by a lack of standardized benchmarks that would allow for consistent evaluations across different studies. In this paper, we introduce TRAM, a temporal reasoning benchmark composed of ten datasets, encompassing various temporal aspects of events such as order, arithmetic, frequency, and duration, designed to facilitate a comprehensive evaluation of the TeR capabilities of large language models (LLMs). We evaluate popular LLMs like GPT-4 and Llama2 in zero-shot and few-shot scenarios, and establish baselines with BERT-based and domain-specific models. Our findings indicate that the best-performing model lags significantly behind human performance. It is our aspiration that TRAM will spur further progress in enhancing the TeR capabilities of LLMs.
研究动机与目标
- 为评估大语言模型(LLMs)中的时间推理能力,解决缺乏统一、标准化基准的问题。
- 全面评估 LLM 在基础与高级时间推理能力方面的能力,包括持续时间、频率、算术、因果关系和时间关系。
- 建立一个支持在不同 LLM 架构和提示策略(零样本、少样本、思维链)下一致评估的基准。
- 识别当前 LLM 的持续局限,特别是在理解隐含时间线索和复杂时间叙述方面。
提出的方法
- TRAM 整合了来自现有数据集、人工设计模板、网络来源和程序化生成的十项不同的时间推理任务。
- 每个任务均以多项选择题形式组织,以实现对 LLM 的标准化、零样本评估。
- 题目源自多样化来源:TimeBank 和 TempEval-3 用于时间关系,SNLI/MNLI 用于时间 NLI,COPA 启发式任务用于因果关系,ROCStories/SCT 用于叙事生成。
- 通过专家标注和程序化生成生成答案,确保高质量且一致的标注。
- 该基准包含 38 个子任务和 526.1 万个问题,涵盖各种情境下的显性和隐性时间表达。
- 采用零样本、少样本和思维链提示策略对模型进行评估,并对 BERT 风格模型在有限数据上进行微调。
实验结果
研究问题
- RQ1当前的大语言模型在统一、全面的时间推理任务基准上的表现如何?
- RQ2不同 LLM 架构(如 GPT-4、Llama2、PaLM2)在理解时间持续时间、频率和算术方面有何相对优势与劣势?
- RQ3大语言模型在处理隐含时间线索(如因果关系或语境化时间指代)方面存在多大程度的困难?
- RQ4与标准提示方法相比,思维链提示在复杂时间推理任务上的表现有何提升?
- RQ5当前最先进 LLM 在时间推理方面与人类水平表现相比差距有多大?
主要发现
- GPT-4 在 TRAM 任务中的平均准确率达到最高,为 87.8%,优于其他 LLM 和 BERT 基模型。
- 尽管表现优异,GPT-4 仍比人类表现低约 10%,表明仍有显著提升空间。
- 模型在处理隐含时间线索(如时间因果关系和细微的事件排序)方面持续存在困难,即使在先进模型中亦是如此。
- 不同任务类型之间存在性能差异,算术和因果关系任务尤其具挑战性。
- 人工错误分析显示,当线索为隐含或依赖语境时,模型常错误理解时间关系。
- 该基准揭示了当前 LLM 在时间叙述和基于事件的推理方面缺乏稳健理解,尤其在真实、语境丰富的场景中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。