Skip to main content
QUICK REVIEW

[论文解读] Lila: A Unified Benchmark for Mathematical Reasoning

Swaroop Mishra, Matthew Finlayson|arXiv (Cornell University)|Oct 31, 2022
Topic Modeling被引用 4
一句话总结

Līla 是一个统一的数学推理基准,涵盖四个维度——数学能力、语言格式、语言多样性及外部知识,包含超过 100,000 个示例,并提供可执行的 Python 程序解法。该基准支持对推理链、泛化能力及鲁棒性的评估,所提出的 Bhāskara 模型在 F1 分数上达到 60.40%,多任务训练相比单任务模型带来 21.83% 的相对 F1 提升。

ABSTRACT

Mathematical reasoning skills are essential for general-purpose intelligent systems to perform tasks from grocery shopping to climate modeling. Towards evaluating and improving AI systems in this domain, we propose LILA, a unified mathematical reasoning benchmark consisting of 23 diverse tasks along four dimensions: (i) mathematical abilities e.g., arithmetic, calculus (ii) language format e.g., question-answering, fill-in-the-blanks (iii) language diversity e.g., no language, simple language (iv) external knowledge e.g., commonsense, physics. We construct our benchmark by extending 20 datasets benchmark by collecting task instructions and solutions in the form of Python programs, thereby obtaining explainable solutions in addition to the correct answer. We additionally introduce two evaluation datasets to measure out-of-distribution performance and robustness to language perturbation. Finally, we introduce BHASKARA, a general-purpose mathematical reasoning model trained on LILA. Importantly, we find that multi-tasking leads to significant improvements (average relative improvement of 21.83% F1 score vs. single-task models), while the best performing model only obtains 60.40%, indicating the room for improvement in general mathematical reasoning and understanding.

研究动机与目标

  • 为解决当前缺乏一个全面的基准来评估人工智能系统在多样化数学主题、问题格式及语言风格下的数学推理能力的问题。
  • 通过扩展现有数据集并增加可执行的 Python 程序解法与基于指令的标注,统一分散的数学推理数据集,以支持基于指令的学习。
  • 通过专门设计的分布外(Līla-OOD)与扰动(Līla-Robust)划分,实现对模型泛化能力与鲁棒性的评估。
  • 在该统一基准上训练并评估通用数学推理模型 Bhāskara,以衡量性能并揭示当前人工智能能力的短板。

提出的方法

  • 通过添加 Python 程序标注作为推理链,扩展了 20 个现有的数学推理数据集,实现解法的可执行验证。
  • 在领域专用语言(DSL)不可用时,通过自动转换与人工专家标注相结合的方式生成程序解法。
  • 将每个示例按四个维度进行分类:数学能力(如算术、微积分)、语言格式(如问答、填空)、语言多样性(无语言、简单、复杂)以及外部知识(常识、物理等)。
  • 引入两个评估划分:Līla-OOD 用于分布外泛化评估,Līla-Robust 用于语言扰动测试(如语音变化),以检验模型鲁棒性。
  • 在完整 Līla 基准上使用多任务学习训练 Bhāskara 模型,以提升推理泛化能力。
  • 使用 F1 分数评估模型在所有测试集、OOD 与鲁棒性划分上的表现,以程序执行结果作为正确性的黄金标准。

实验结果

研究问题

  • RQ1一个整合多样化数学推理任务的统一基准,是否能超越狭窄的、任务特定的数据集,提升对人工智能系统评估的全面性?
  • RQ2与单任务微调相比,基于统一基准的多任务训练在多大程度上能提升数学推理性能?
  • RQ3当前最先进模型在需要相同底层数学技能但表述或格式不同的分布外示例上,其泛化能力如何?
  • RQ4当前模型对语言扰动(如主动/被动语态转换或同义词替换)的鲁棒性如何?
  • RQ5在全面的、带有程序标注的数学推理基准上,当前模型的性能上限是什么?

主要发现

  • Bhāskara 模型在 Līla 基准上取得 60.40% 的 F1 分数,表明通用数学推理能力仍有显著提升空间。
  • 多任务训练相比单任务模型带来 21.83% 的相对 F1 提升,证明在多样化数学任务上联合学习具有显著优势。
  • Codex 在大多数数据集上表现优于其他基线模型,平均 F1 分数达到最高值 61.3%,其次为 GPT-3 和微调后的 GPT-Neo 模型。
  • 模型在简单、结构化的问题(如 singleop、multiarith)上表现良好,但在复杂、自然语言表达的问题(如 mathqa_geometry、svamp_structured)上表现不佳,尤其在语言复杂或模糊时。
  • Līla-OOD 与 Līla-Robust 划分揭示,模型在不同表达方式与语言变体上的泛化能力较差,凸显当前推理泛化能力的关键短板。
  • 可执行程序解法的引入使得推理链的评估更加精确,揭示出模型常通过有缺陷或错误的推理路径得出正确答案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。