[论文解读] Solving Math Word Problems with Double-Decoder Transformer
该论文提出了一种用于数学应用题求解的双解码器Transformer模型,该模型在不使用复制或对齐机制的情况下生成方程,通过共享编码器联合训练两个解码器——一个从左到右,一个从右到左。模型在最大似然估计(MLE)下达到21.7%的准确率,在强化学习(RL)下达到22.1%的准确率,优于RNN和单解码器Transformer,证明了即使在无需集成推理的情况下,双向解码也能提升训练和泛化能力。
This paper proposes a Transformer-based model to generate equations for math word problems. It achieves much better results than RNN models when copy and align mechanisms are not used, and can outperform complex copy and align RNN models. We also show that training a Transformer jointly in a generation task with two decoders, left-to-right and right-to-left, is beneficial. Such a Transformer performs better than the one with just one decoder not only because of the ensemble effect, but also because it improves the encoder training procedure. We also experiment with adding reinforcement learning to our model, showing improved performance compared to MLE training.
研究动机与目标
- 开发一种神经序列到序列模型,能够从应用题中生成准确的数学方程,且不依赖复制或对齐机制。
- 探究使用两个方向相反的解码器联合训练的Transformer模型是否在性能上优于单解码器模型。
- 评估使用双向解码器联合训练对编码器表征学习及整体方程生成质量的影响。
- 评估强化学习是否能在该任务中进一步提升性能,超越最大似然估计(MLE)训练。
- 将所提模型在Dolphin18K数据集上的性能与当前最先进的基于检索和混合RNN模型进行比较。
提出的方法
- 采用基于Transformer的序列到序列架构,包含两个解码器:一个从左到右生成方程,另一个从右到左生成方程,两者共享同一个编码器。
- 使用三种类型的数值标记——负数、(0,1)之间的浮点数及其他数值——来表示输入和输出序列中的数值,避免直接复制标记。
- 使用最大似然估计(MLE)和交叉熵损失进行训练,其中编码器的优化基于两个解码器的联合损失。
- 在MLE训练后应用强化学习(REINFORCE),以方程正确性(通过SymPy验证)作为奖励信号,对模型进行微调。
- 推理时采用束搜索(beam size=10),强化学习采样时使用束大小6,奖励计算为N个采样输出平均准确率。
- 使用GloVe 840B 300d词嵌入表示输入文本,嵌入后接一个512维前馈网络以匹配Transformer的维度。
实验结果
研究问题
- RQ1与不使用复制或对齐机制的单解码器Transformer相比,采用两个解码器(从左到右和从右到左)的Transformer模型是否能提升方程生成性能?
- RQ2即使推理时仅使用一个解码器的输出,联合训练双向解码器是否能增强编码器的表征学习?
- RQ3强化学习在多大程度上能提升Transformer-based方程生成器的性能,使其超越MLE训练?
- RQ4在Dolphin18K数据集上,所提模型的准确率与当前最先进的基于检索和混合RNN模型相比如何?
- RQ5由于缺乏复制和对齐机制,性能是否受到限制?还是该模型具备足够的泛化能力,能够超越使用这些机制的更复杂的RNN模型?
主要发现
- 双解码器Transformer在MLE训练下达到21.7%的准确率,显著优于单解码器Transformer(19.4%)和所有不使用复制/对齐机制的RNN模型。
- 即使仅使用一个解码器的输出(不进行集成投票),双解码器模型在从左到右方向仍达到20.6%准确率,在从右到左方向达到20.2%准确率,表明双向监督有效提升了编码器的训练质量。
- 强化学习将性能提升至22.1%准确率,表明RL微调能进一步改善泛化能力,超越MLE训练。
- 尽管未使用复制或对齐机制,该模型仍优于使用这些模块的RNN模型,包括表现最佳的RNN模型(使用RL和复制/对齐机制时准确率为23.3%)。
- 该模型未超越最佳基于检索的系统(如混合GRU+复制+对齐+RL系统,准确率为33.2%),这归因于数据集中真实标签方程的质量较低。
- 结果表明,若方程标注更具结构性,将显著提升生成模型的性能,因为当前的方程常缺乏推导清晰性或包含无法追溯的数值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。