[论文解读] In-context Learning Distillation: Transferring Few-shot Learning Ability of Pre-trained Language Models
本文提出了一种上下文学习蒸馏(ICL-D)方法,这是一种知识蒸馏框架,通过联合优化上下文学习与语言建模目标,将大型预训练语言模型的 few-shot 学习能力迁移至更小的 student 模型。该方法在 LAMA 和 CrossFit 基准测试中达到最先进性能,student 模型参数量最多仅为教师模型的 1/13.4,推理速度提升 3.6 倍,同时保留了教师模型 91.4% 的性能。
Given the success with in-context learning of large pre-trained language models, we introduce in-context learning distillation to transfer in-context few-shot learning ability from large models to smaller models. We propose to combine in-context learning objectives with language modeling objectives to distill both the ability to read in-context examples and task knowledge to the smaller models. We perform in-context learning distillation under two different few-shot learning paradigms: Meta In-context Tuning (Meta-ICT) and Multitask In-context Tuning (Multitask-ICT). Multitask-ICT performs better on multitask few-shot learning but also requires more computation than Meta-ICT. Our method shows consistent improvements for both Meta-ICT and Multitask-ICT on two benchmarks: LAMA and CrossFit. Our extensive experiments and analysis reveal that in-context learning objectives and language modeling objectives are complementary under the Multitask-ICT paradigm. In-context learning objectives achieve the best performance when combined with language modeling objectives.
研究动机与目标
- 解决大型预训练语言模型在实时和资源受限系统中计算成本高、部署困难的问题。
- 将大型教师模型的 few-shot 上下文学习能力迁移至更小的 student 模型,实现高效部署。
- 探究是否可通过知识蒸馏有效迁移上下文学习能力,尤其是在多任务 few-shot 场景下。
- 探索上下文学习与语言建模目标在 few-shot 学习蒸馏中的互补作用。
- 提出一种新型 few-shot 学习范式——多任务上下文微调(Multitask In-context Tuning, Multitask-ICT),在计算成本更高的前提下,性能优于 Meta-ICT。
提出的方法
- 提出上下文学习蒸馏(ICL-D),一种教师-学生框架,将大型教师模型的上下文学习行为与特定任务知识同时蒸馏至更小的 student 模型。
- 结合上下文学习目标(即从输入-输出示例中推理任务)与语言建模目标,以增强知识迁移效果。
- 在两种 few-shot 学习范式下应用蒸馏框架:Meta-ICT(在多样化任务上进行元训练)与 Multitask-ICT(在多个 few-shot 任务上联合微调)。
- 提出 Multitask-ICT 作为新范式,在推理前对模型进行多目标任务的上下文示例微调,从而在性能上超越 Meta-ICT。
- 利用教师模型的软标签指导 student 模型的预测分布,同时借助教师模型的隐藏表征实现知识迁移。
- 采用双目标训练目标:一个用于上下文学习(基于示例条件),一个用于语言建模(下一项词预测),两者联合优化。
实验结果
研究问题
- RQ1能否通过知识蒸馏,将大型预训练语言模型的上下文 few-shot 学习能力有效迁移至更小的 student 模型?
- RQ2在蒸馏过程中,上下文学习目标与语言建模目标如何相互作用并实现互补?
- RQ3所提出的 Multitask-ICT 范式是否在 few-shot 学习性能上优于 Meta-ICT,其计算成本如何?
- RQ4元训练任务的分布在多大程度上影响 Meta-ICT 的性能?蒸馏是否能缓解数据稀疏性问题?
- RQ5仅使用语言建模目标的蒸馏能否传递对上下文学习有用的表征知识?还是必须依赖上下文学习监督?
主要发现
- 在 Meta-ICT 和 Multitask-ICT 两种范式下,ICL-D 在 LAMA 和 CrossFit 基准测试中均一致提升了 few-shot 性能。
- Multitask-ICT 在 few-shot 学习准确率上优于 Meta-ICT,但在适应阶段需要显著更高的计算资源。
- 在 Multitask-ICT 中,上下文学习与语言建模目标的结合取得了最佳性能,证明了二者具有显著互补性。
- 仅使用语言建模蒸馏时性能表现较差,在 Setting 3 中仅达到 18.5% 的 P@1,表明缺乏上下文学习监督时效果不足。
- 在 Multitask-ICT 下,将 student 模型缩小至教师模型的 1/13.4 时,仍能保留 CrossFit 上 91.4% 的性能。
- 模型参数量减少 93% 时,推理速度提升 1.7 倍,性能保留率达 91.4%,且部分更小的模型甚至超越了教师模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。