[论文解读] MinT: Boosting Generalization in Mathematical Reasoning via Multi-View Fine-Tuning
MinT 提出了一种多视角微调方法,通过将不同数据集中的多样化注释格式视为不同的'视角',并使用特定于视角的指令训练模型以生成这些格式的解法,从而提升小型语言模型的数学推理能力。该方法在四个基准测试中实现了最先进性能,优于基于知识蒸馏的方法,且无需依赖大型低效的教师模型。
Reasoning in mathematical domains remains a significant challenge for relatively small language models (LMs). Many current methods focus on specializing LMs in mathematical reasoning and rely heavily on knowledge distillation from powerful but inefficient large LMs (LLMs). In this work, we explore a new direction that avoids over-reliance on LLM teachers, introducing a multi-view fine-tuning method that efficiently exploits existing mathematical problem datasets with diverse annotation styles. Our approach uniquely considers the various annotation formats as different "views" and leverages them in training the model. By postpending distinct instructions to input questions, models can learn to generate solutions in diverse formats in a flexible manner. Experimental results show that our strategy enables a LLaMA-7B model to outperform prior approaches that utilize knowledge distillation, as well as carefully established baselines. Additionally, the proposed method grants the models promising generalization ability across various views and datasets, and the capability to learn from inaccurate or incomplete noisy data. We hope our multi-view training paradigm could inspire future studies in other machine reasoning domains.
研究动机与目标
- 解决从大型低效大语言模型进行知识蒸馏在训练小型模型进行数学推理时的局限性。
- 通过将多样化注释格式作为问题解决的独立'视角',提升小型语言模型的泛化能力与鲁棒性。
- 实现对现有公开可用、格式各异且可能存在噪声的数据集的有效利用,而无需依赖昂贵的大语言模型生成的注释。
- 探究在多个视角上进行训练是否能提升推理性能及在不同数据集和格式间的适应能力。
- 开发一种数据高效、可扩展的方法,使其在不同模型架构和噪声数据上均具有泛化能力。
提出的方法
- 该方法将不同类型的解法注释格式——如叙述性逐步推理、基于方程的解法以及扁平化程序——视为数学问题解决的不同'视角'。
- 采用视角转换技术,通过将一种格式的数据转换为其他格式,扩展解法视角的数量,从而提升训练多样性。
- 在微调过程中,向输入问题附加特定的指令前缀,以引导模型生成目标视角的输出,实现灵活的、视角特定的生成。
- 在包含多种视角的多个数据集上端到端训练模型,使其学习跨视角的推理模式,提升泛化能力。
- 该方法与模型架构无关,可应用于多种主干模型,包括 LLaMA-7B 和 BLOOMz-7B。
- 不依赖大型语言模型进行数据生成;相反,该方法利用现有数据集并仅进行最少的预处理。

实验结果
研究问题
- RQ1在多样化注释格式(视角)上进行训练,是否能提升小型语言模型的数学推理性能?
- RQ2多视角微调是否能增强在未见数据集和解法格式上的泛化能力?
- RQ3通过将噪声或不完整数据视为新视角,该方法能否有效处理此类数据?
- RQ4MinT 的性能与依赖大型教师模型的知识蒸馏方法相比如何?
- RQ5该方法在不同主干语言模型上的泛化能力有多大?
主要发现
- 经过 MinT 微调的 LLaMA-7B 模型在四个基准测试(包括 GSM8K、MathQA、Ape210K 和 MAWPS)上优于以往基于知识蒸馏的方法。
- 在使用基于方程解法的 MAWPS 数据集上,MinT 微调的模型在生成逐步思维链解法时达到了 58.5% 的准确率,表明其具备强大的跨视角泛化能力。
- 在更多数据集和视角上进行训练能持续提升性能,其中在全部六个数据集上训练的模型在所有视角中均达到最高准确率。
- 该方法在不同主干模型上表现出强适应能力,在 LLaMA-7B 和 BLOOMz-7B 上均实现了稳定的性能提升。
- 通过将噪声数据视为额外视角,模型展现出对噪声数据的鲁棒性,提升了整体性能,且无需进行数据清洗。
- 该方法通过简单的指令微调实现了对生成过程的有效控制,即使在使用不完整或无关的数据源时,也能生成高质量输出。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。