[论文解读] NT5?! Training T5 to Perform Numerical Reasoning
本文提出 NT5,一种序列式预训练框架,通过在合成数值(NUM)和文本(TXT)数据集以及 SQuAD 上进行预训练,随后在 DROP 上微调,将 T5-Small 适配用于文本中的数值推理(NRoT)。该方法在 DROP 的调整后 F1 得分为 70.83,显著缩小了与 GenBERT 等更大模型的差距,同时仅使用 6000 万参数,且无需人工设计符号模块工程。
Numerical reasoning over text (NRoT) presents unique challenges that are not well addressed by existing pre-training objectives. We explore five sequential training schedules that adapt a pre-trained T5 model for NRoT. Our final model is adapted from T5, but further pre-trained on three datasets designed to strengthen skills necessary for NRoT and general reading comprehension before being fine-tuned on the Discrete Reasoning over Text (DROP) dataset. The training improves DROP's adjusted F1 performance (a numeracy-focused score) from 45.90 to 70.83. Our model closes in on GenBERT (72.4), a custom BERT-Base model using the same datasets with significantly more parameters. We show that training the T5 multitasking framework with multiple numerical reasoning datasets of increasing difficulty, good performance on DROP can be achieved without manually engineering partitioned functionality between distributed and symbol modules.
研究动机与目标
- 在不依赖混合神经-符号架构的前提下,提升类似 T5 的预训练序列到序列模型在文本数值推理(NRoT)任务上的性能。
- 探究在合成数据集和通用阅读理解数据集上进行序列式预训练,是否能有效使纯神经模型内化数值推理能力。
- 评估验证数据集选择(DROP 与合成数据集)对模型泛化能力和性能的影响。
- 确定在多个数据集上进行多任务预训练是否相比顺序训练能提升在 DROP 上的性能。
- 在 DROP 基准上对小型 T5 模型与 GenBERT 和 QDGAT-ALBERT 等更大、更专业的模型进行性能基准测试。
提出的方法
- 该方法采用序列式训练流程:首先在合成 NUM 和 TXT 数据集上预训练,然后在 SQuAD 上继续预训练,最后在 DROP 和一个 DROP 分类任务上进行微调。
- 在每个阶段应用多任务训练,使用温度缩放和特殊标记来标识数据源。
- 模型从 T5-Small(6000 万个参数)初始化,并使用标准 T5 文本到文本目标进行训练,配合特定任务的提示模板。
- 通过在 DROP 开发集或合成数据集的开发集上进行验证,比较泛化能力和模型选择性能。
- 最终模型在 DROP 和一个派生的分类任务上进行微调,并对验证策略和多任务调度进行消融实验。
- 性能通过 DROP 的调整后 F1、EM 和按问题类型分解的 F1 得分进行评估。
实验结果
研究问题
- RQ1一个纯神经的 T5 模型是否能在不集成显式符号模块的情况下,在文本数值推理(NRoT)任务上取得优异表现?
- RQ2与标准微调相比,在合成数值和文本数据集上进行序列式预训练是否能提升模型在 DROP 上的泛化能力和性能?
- RQ3选择验证数据集(DROP 与合成数据集)如何影响模型选择和最终性能?
- RQ4在预训练阶段加入 SQuAD 能在多大程度上提升阅读理解与数值推理能力?
- RQ5在所有数据集上同时进行多任务预训练是否优于顺序预训练?
主要发现
- 表现最佳的模型在 DROP 测试集上取得了 70.83 的调整后 F1 得分,相比基线 T5-Small 的 45.90 显著提升。
- 在经过 NUM、TXT 和 SQuAD 的序列式预训练后,模型在数值类问题上的 F1 得分从基线的 31.83 提升至 70.39。
- 在预训练阶段使用合成数据集(NUM/TXT)进行验证,相比在 DROP 开发集上验证,泛化能力更强,F1 得分高出 3.37 个百分点(50.32 vs. 46.95)。
- 在预训练阶段加入 SQuAD 平均使阅读理解 F1 提升 3.06 个百分点,且对数值推理性能无明显负面影响。
- 在所有数据集上同时进行多任务预训练的性能比顺序预训练低近 6 个百分点的 F1,表明分阶段预训练更为有效。
- 该模型仅使用 6000 万个参数,就在 DROP 上取得了优异表现(67.0 EM,70.8 F1),接近 GenBERT(72.4 F1),尽管参数更少且未使用符号模块。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。