Skip to main content
QUICK REVIEW

[论文解读] Translating a Math Word Problem to an Expression Tree

Lei Wang, Yan Wang|arXiv (Cornell University)|Nov 14, 2018
Intelligent Tutoring Systems and Adaptive Learning被引用 10
一句话总结

本文提出了一种方程归一化方法,可将数学应用题中的多个等价方程映射到唯一的表达式树,从而减少序列到序列模型的输出歧义。通过使用排序和括号规则对方程进行归一化,并将三种最先进(SOTA)的序列到序列模型(Bi-LSTM、ConvS2S、Transformer)组合成集成模型,该方法将Math23K数据集上的准确率从60.7%提升至68.4%,创下新的最先进水平。

ABSTRACT

Sequence-to-sequence (SEQ2SEQ) models have been successfully applied to automatic math word problem solving. Despite its simplicity, a drawback still remains: a math word problem can be correctly solved by more than one equations. This non-deterministic transduction harms the performance of maximum likelihood estimation. In this paper, by considering the uniqueness of expression tree, we propose an equation normalization method to normalize the duplicated equations. Moreover, we analyze the performance of three popular SEQ2SEQ models on the math word problem solving. We find that each model has its own specialty in solving problems, consequently an ensemble model is then proposed to combine their advantages. Experiments on dataset Math23K show that the ensemble model with equation normalization significantly outperforms the previous state-of-the-art methods.

研究动机与目标

  • 解决由于同一道数学应用题存在多个有效方程而导致的序列到序列模型在数学应用题求解中输出空间非确定性的问题。
  • 通过将等价方程归一化为唯一的表达式树表示,提升序列到序列模型在数学应用题求解中的性能。
  • 探究不同序列到序列架构(Bi-LSTM、ConvS2S、Transformer)在求解数学应用题方面的互补优势,并通过集成学习方法进行结合。
  • 证明方程归一化与模型集成能显著提升Math23K基准测试中的最先进性能。

提出的方法

  • 应用数字映射以识别问题中的关键数字,并用占位符(如n1、n2)替换,从而生成方程模板。
  • 引入两条归一化规则:(1) 当模板长度不同时,优先选择较短的模板;(2) 按照原始问题中占位符的出现顺序进行排序。
  • 去除冗余括号,以消除基于括号的方程重复问题。
  • 在归一化的方程模板上训练并比较三种最先进(SOTA)的序列到序列模型——Bi-LSTM、ConvS2S和Transformer。
  • 通过结合三种模型的预测结果构建集成模型,以发挥其互补优势。
  • 使用束搜索解码和后处理步骤,将标记化的方程模板还原为数值解。

实验结果

研究问题

  • RQ1将多个等价方程归一化为单一表达式树表示,是否能提升序列到序列模型在数学应用题求解中的性能?
  • RQ2不同的序列到序列架构(Bi-LSTM、ConvS2S、Transformer)在求解不同类型数学应用题时是否表现出不同的优势?
  • RQ3方程归一化在多大程度上减少了歧义并提升了最大似然估计的训练稳定性?
  • RQ4多样化的序列到序列模型集成是否能在数学应用题基准测试中超越单一模型?

主要发现

  • 方程归一化提升了所有单个模型的准确率,不同架构的准确率提升范围在2.7%至7.1%之间。
  • 归一化后,Bi-LSTM模型达到最高的单模型准确率66.7%,其次是ConvS2S(64.2%)和Transformer(62.3%)。
  • 集成模型达到最高的准确率68.4%,相比表现最佳的单个模型(Bi-LSTM)提升了1.7%。
  • 消融实验表明,去除括号(EB)对性能提升贡献最大(Bi-LSTM达到65.3%),其次是规则2(63.7%)和规则1(63.1%)。
  • 案例研究显示,Transformer模型凭借多头注意力机制在复杂推理任务中表现优异,而ConvS2S则通过卷积模块有效捕捉上下文关系。
  • 该方法有效减少了方程重复,使序列到序列模型的训练过程更加确定且稳定。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。