[论文解读] Giving BERT a Calculator: Finding Operations and Arguments with Reading Comprehension
本文提出通过轻量级可执行程序增强基于 BERT 的阅读理解模型,以实现数值推理,使其能够预测操作(例如,Diff、Sum、Mul、Div)和参数(数字跨度),从而生成生成式数值答案。该模型在 DROP 数据集上实现了 33% 的绝对 F1 提升,并在少样本学习设置下泛化到数学应用题,优于先前方法在两项任务上的表现。
Reading comprehension models have been successfully applied to extractive text answers, but it is unclear how best to generalize these models to abstractive numerical answers. We enable a BERT-based reading comprehension model to perform lightweight numerical reasoning. We augment the model with a predefined set of executable 'programs' which encompass simple arithmetic as well as extraction. Rather than having to learn to manipulate numbers directly, the model can pick a program and execute it. On the recent Discrete Reasoning Over Passages (DROP) dataset, designed to challenge reading comprehension models, we show a 33% absolute improvement by adding shallow programs. The model can learn to predict new operations when appropriate in a math word problem setting (Roy and Roth, 2015) with very few training examples.
研究动机与目标
- 解决抽取式阅读理解模型在处理需要生成式答案的数值推理任务时的局限性。
- 提升在 DROP 数据集上的表现,该数据集通过离散性、定量推理挑战模型,超越简单的跨度抽取。
- 实现一个统一模型,通过最小的架构修改同时处理传统阅读理解与数值推理任务。
- 研究在少量训练数据下对新操作(例如,乘法、除法)在数学应用题中的泛化能力。
- 通过符号化程序预测提供可解释性,以反映推理步骤。
提出的方法
- 在基于 BERT 的抽取式 QA 模型基础上,增加一组预定义的可执行程序,包括算术运算(Diff、Sum、Mul、Div)、跨度抽取和逻辑运算。
- 通过预测程序(操作与参数)而非直接预测数值答案进行训练,将计算任务交由计算器处理。
- 将参数作为对文本中数字或跨度的指针,支持操作的组合(例如,Diff(Sum(a,b), c))。
- 在 CoQA 上进行联合训练,以在提升 DROP 表现的同时保持传统阅读理解性能。
- 在 DROP 上进行微调,并通过模型集成提升性能,重点解决多跨度答案中的类别不平衡问题。
- 在伊利诺伊州数学应用题数据集上应用少样本学习,以评估对未见操作的泛化能力。
实验结果
研究问题
- RQ1能否通过轻量级可执行程序增强基于 BERT 的模型,以提升在 DROP 等数值推理任务上的表现?
- RQ2该模型在极少数训练样本下,对数学应用题中新操作(例如,乘法、除法)的泛化能力如何?
- RQ3该模型能否在提升 DROP 表现的同时,保持在传统阅读理解任务(例如,CoQA)上的强性能?
- RQ4程序级解释(例如,预测 Diff(55893, 48341))是否能提升模型的可解释性与推理保真度?
- RQ5组合操作(例如,Sum3、Merge)在复杂答案类型上的性能提升程度如何?
主要发现
- 该模型在 DROP 开发集上达到 81.1 的 F1 分数,相较于之前的 SOTA 模型 NAQANet 实现了 33% 的绝对提升。
- 增加 Diff100 和 Sum3 操作分别带来了 9% 和 1.1% 的相对性能提升,与数据中这些操作的出现频率一致。
- 在 CoQA 上进行联合训练不仅提升了 DROP 表现,还保持了 CoQA 上 82.2 的 F1 分数,证明了双任务能力。
- 在 DROP 上预训练并微调 IL 数据后,该模型在伊利诺伊州数学应用题数据集上达到 83.2% 的准确率,优于先前的基于规则和深度强化学习的模型。
- 该模型仅用 562 个训练样本就学会了在数学应用题中预测乘法与除法操作,展现出强大的少样本泛化能力。
- 集成六个模型使性能进一步提升 1%,最终在 DROP 上达到 81.1 的 F1 分数。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。