[论文解读] NumGLUE: A Suite of Fundamental yet Challenging Mathematical Reasoning Tasks
本文提出了 NumGLUE,一个包含八个算术推理任务的多任务基准——其中四个为新任务,四个为现有任务——旨在评估人工智能系统在格式无关条件下的稳健数值推理能力。尽管采用了最先进的模型(如微调后的 GPT-3-13B),其性能仍显著落后于人类水平(平均低 46.4%),且跨任务联合训练仅带来 3.4% 的平均性能提升,表明自然语言处理中亟需具备泛化能力的算术推理能力。
Given the ubiquitous nature of numbers in text, reasoning with numbers to perform simple calculations is an important skill of AI systems. While many datasets and models have been developed to this end, state-of-the-art AI systems are brittle; failing to perform the underlying mathematical reasoning when they appear in a slightly different scenario. Drawing inspiration from GLUE that was proposed in the context of natural language understanding, we propose NumGLUE, a multi-task benchmark that evaluates the performance of AI systems on eight different tasks, that at their core require simple arithmetic understanding. We show that this benchmark is far from being solved with neural models including state-of-the-art large-scale language models performing significantly worse than humans (lower by 46.4%). Further, NumGLUE promotes sharing knowledge across tasks, especially those with limited training data as evidenced by the superior performance (average gain of 3.4% on each task) when a model is jointly trained on all the tasks as opposed to task-specific modeling. Finally, we hope that NumGLUE will encourage systems that perform robust and general arithmetic reasoning within language, a first step towards being able to perform more complex mathematical reasoning.
研究动机与目标
- 解决当前人工智能系统在问题格式变化时算术推理能力脆弱的问题。
- 开发一个多任务基准,用于评估在多样化数值推理格式下的泛化能力。
- 识别最先进的模型(如 GPT-3)在不同语言语境中处理数字推理时的根本性局限。
- 证明跨任务联合训练可通过知识迁移提升性能,尤其对低数据量任务效果显著。
- 推动研究朝向可泛化、格式无关的数值推理方向发展,作为复杂数学推理的基础。
提出的方法
- 设计一个包含八个不同任务的多任务基准,其中四个为新任务,每个任务均需核心算术推理能力。
- 整理约 10 万道题目,涵盖各类格式(如应用题、填空题、自然语言推理、比较题)的同时保持算术复杂度。
- 在任务特定训练与多任务学习设置下,训练并评估多种基线模型,包括一种记忆增强神经网络(Ex-NumNet)和微调后的 GPT-3。
- 实现条件信息检索(CIR)模块,以增强依赖知识的任务中的推理能力。
- 采用过采样策略缓解任务间的数据不平衡问题,并与多任务学习的效果进行对比。
- 对每个任务的 50 个样本进行错误分析,将失败模式分类为:无效输出、数字复制、计算错误和冗余文本。
实验结果
研究问题
- RQ1人工智能模型能否在多种问题格式(如应用题、填空题、自然语言推理、比较题)之间实现算术推理的泛化?
- RQ2当问题格式发生变化时,最先进的大语言模型(如 GPT-3)在简单算术推理任务上失败的程度有多大?
- RQ3与任务特定微调相比,跨多样化算术任务进行联合多任务训练是否能带来性能提升与知识迁移?
- RQ4在数值推理任务上,端到端模型(如 GPT-3)与神经符号模型(如 Ex-NumNet)在性能与鲁棒性方面有何差异?
- RQ5当前模型中最主要的错误类型是什么?这些错误能否通过架构或训练策略的改进得以缓解?
主要发现
- 最先进的大语言模型(包括微调后的 GPT-3-13B)在 NumGLUE 任务上的平均性能比人类低 46.4%,表明其在算术推理泛化能力上存在根本性差距。
- 与任务特定训练相比,对全部八个任务进行联合训练可使每个任务的平均性能提升 3.4%,证明了知识迁移的有效性。
- GPT-3-13B 在需要外部知识的任务中表现优于其他基线模型,可能归因于其在大规模网络语料上的预训练。
- 最常见的错误类型为计算错误(Ex-NumNet 为 71%,GPT-3 为 56%),其次是无效输出和冗余文本生成。
- 过采样可提升低数据量任务的性能,但会损害高数据量任务的表现,且从未超过结合条件信息检索的多任务基线模型。
- 错误分析显示,模型常直接复制数字而未进行计算,且 GPT-3 生成的冗余文本远多于 Ex-NumNet。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。