[论文解读] Investigating Math Word Problems using Pretrained Multilingual Language Models
本文研究使用预训练多语言语言模型进行跨语言和多语言数学应用题(MWP)求解,提出在 mBERT 和 XLM-R 上使用带复制机制的序列到序列模型。结果表明,即使共享运算符和常数,MWP 求解器在不同语言间仍难以迁移,但当训练和评估问题具有相似的问题类型时,性能显著提升,凸显领域相似性是关键因素,而非语言相似性。
In this paper, we revisit math word problems~(MWPs) from the cross-lingual and multilingual perspective. We construct our MWP solvers over pretrained multilingual language models using sequence-to-sequence model with copy mechanism. We compare how the MWP solvers perform in cross-lingual and multilingual scenarios. To facilitate the comparison of cross-lingual performance, we first adapt the large-scale English dataset MathQA as a counterpart of the Chinese dataset Math23K. Then we extend several English datasets to bilingual datasets through machine translation plus human annotation. Our experiments show that the MWP solvers may not be transferred to a different language even if the target expressions have the same operator set and constants. But for both cross-lingual and multilingual cases, it can be better generalized if problem types exist on both source language and target language.
研究动机与目标
- 研究基于多语言预训练的 MWP 求解器是否能在一种语言上训练后泛化到另一种语言。
- 评估结合多语言数据集是否能提升跨语言 MWP 求解性能。
- 识别影响跨语言和多语言 MWP 泛化的关键因素,如语言相似性、运算符集合和问题类型。
- 通过将现有英文数据集翻译并人工标注,构建并发布新的双语 MWP 数据集,以支持对比分析。
- 实证评估对比学习和基于模板的训练在提升零样本和少样本 MWP 泛化能力方面的有效性。
提出的方法
- 在单语和多语言 MWP 数据集上微调多语言 BERT(mBERT)和 XLM-Roberta(XLM-R),使用带复制机制的序列到序列模型。
- 将大规模英文 MathQA 数据集调整为与中文 Math23K 数据集的运算符集合和表达式格式一致,以实现一致比较。
- 通过机器翻译将 MathQA 和 Math23K 翻译为中文,并经人工标注进行质量控制,构建双语 MWP 数据集。
- 应用基于模板的对比学习,通过跨语言对齐语义相似的问题模板,提升零样本泛化能力。
- 在单张 2080Ti GPU 上以 160 的批量大小训练模型,使用多项式衰减学习率调度器,并在连续 30 个周期无提升后早停。
- 在单语测试集、零样本跨语言设置和双语评估集上评估模型,以衡量迁移能力和多语言泛化性能。
实验结果
研究问题
- RQ1在使用多语言预训练的前提下,基于单语数据集(如中文 Math23K)训练的 MWP 求解器是否能成功求解另一种语言(如英文)的问题?
- RQ2将来自多种语言的单语数据集合并为单一多语言训练集,是否能提升每个语言的性能,相比单语训练?
- RQ3即使运算符和常数相同,源语言和目标语言之间的问题类型相似性在多大程度上影响跨语言 MWP 求解性能?
- RQ4基于模板的对比学习在跨语言的零样本和少样本 MWP 泛化中产生何种影响?
- RQ5语言相似性、领域相似性或运算符集合一致性中,哪一因素最能影响多语言 MWP 求解器的成功?
主要发现
- 在中文 Math23K 上训练的单语 MWP 求解器(mBERT-zh)在其自身测试集上达到 76.3% 的准确率,但在英文问题上评估时下降至 49.5%,表明尽管共享运算符和常数,其跨语言迁移能力接近为零。
- 在 Math23K 和调整后的 MathQA 上联合训练的多语言模型(mBERT-xl)在英文上达到 79.0% 准确率,在中文上达到 76.3%,优于单语模型在两种语言上的表现,表明多语言训练可提升语言无关的性能。
- 当不同语言间的问题类型相似时,多语言训练带来的性能提升最为显著;例如,与单语基线相比,mBERT-xl 在 Math23K 上提升 3.1 分,在 MathQA 上提升 2.4 分。
- 基于模板的对比学习可使测试集性能最高提升 3 分(例如,Math23K 上从 76.3% 提升至 79.4%),但损害了英文的零样本性能,可能因数据集间模板多样性不匹配所致。
- 当仅共享两种语言中均存在的模板时,模型在测试集上的性能有所下降,但在零样本英文评估中提升最大,证实问题类型对齐比语言本身对泛化更为关键。
- 本研究表明,即使运算符集合和常数完全相同,领域相似性(问题类型)仍是 MWP 求解器泛化能力的更强预测因子,而非语言相似性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。