[论文解读] Teaching Small Language Models to Reason
本文提出通过在思维链(CoT)输出上微调,实现从大语言模型(LLMs)到小模型的知识蒸馏,显著提升了在算术、常识和符号推理任务上的推理性能。在 PaLM 540B 和 GPT-3 175B 生成的 CoT 数据上微调 T5 XXL,使 GSM8K 上的准确率分别从 8.11% 提升至 21.99% 和 18.42%,证明了推理能力可有效迁移到小型模型。
Chain of thought prompting successfully improves the reasoning capabilities of large language models, achieving state of the art results on a range of datasets. However, these reasoning capabilities only appear to emerge in models with a size of over 100 billion parameters. In this paper, we explore the transfer of such reasoning capabilities to models with less than 100 billion parameters via knowledge distillation. Specifically, we finetune a student model on the chain of thought outputs generated by a larger teacher model. Our experiments show that the proposed method improves task performance across arithmetic, commonsense and symbolic reasoning datasets. For example, the accuracy of T5 XXL on GSM8K improves from 8.11% to 21.99% when finetuned on PaLM-540B generated chains of thought.
研究动机与目标
- 探究是否可通过知识蒸馏将大语言模型(LLMs)的推理能力有效迁移到小型模型。
- 评估学生模型大小和数据集大小在 CoT 蒸馏后对推理性能的影响。
- 确定在 few-shot prompt 中提供目标答案是否能提升 CoT 质量以用于蒸馏。
- 证明在高质量 CoT 输出上微调小型模型可显著提升多个推理基准任务的准确率。
提出的方法
- 通过使用 8 个示例的 few-shot prompting,利用大教师模型(PaLM 540B 和 GPT-3 175B)为现有数据集生成思维链(CoT)推理步骤。
- 修改 few-shot prompt,将目标答案置于问题之后,通过允许推理过程中的错误纠正来提升 CoT 质量。
- 通过将推理输出与真实答案对比,筛选掉错误的 CoT 示例,确保仅使用高质量数据进行蒸馏。
- 使用教师强制法微调小型学生模型(T5 XXL、XL、base),其中输入为问题,目标为 CoT 加上答案。
- 推理时使用相同的 prompt 格式,使学生模型在推理时无需额外 prompting 即可生成 CoT。
- 使用标准准确率指标,在算术、常识和符号推理数据集上评估性能。
实验结果
研究问题
- RQ1是否能通过知识蒸馏有效将大语言模型的推理能力迁移到小型模型?
- RQ2CoT 蒸馏后,学生模型的大小如何影响性能?
- RQ3数据集大小对 CoT 蒸馏有效性有何影响?
- RQ4在 few-shot prompt 中包含目标答案是否能提升生成 CoT 的质量及下游性能?
- RQ5教师模型的选择(PaLM 540B 与 GPT-3 175B)如何影响蒸馏性能?
主要发现
- 在 PaLM 540B 生成的 CoT 数据上微调 T5 XXL,使 GSM8K 上的准确率从 8.11% 提升至 21.99%。
- 在 GPT-3 175B 生成的 CoT 数据上微调 T5 XXL,使 GSM8K 上的准确率提升至 18.42%。
- T5 base 模型的参数量仅为 T5 XXL 的 1/44,但在 CoT 数据上微调后,性能与基线 T5 XXL 相当。
- 即使 T5 small 模型在提供外部计算器的情况下,也优于基线 T5 XXL,表明推理能力迁移效果显著。
- 该方法的数据效率提高 6 倍:仅使用 GSM8K 数据的 20% 训练,准确率即可达到 11.22%,而基线为 8.11%。
- 性能提升在算术推理任务上最为显著,而在 StrategyQA 上提升有限,可能由于小型模型在事实知识方面的局限性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。