[论文解读] It's Not Just Size That Matters: Small Language Models Are Also Few-Shot Learners
该论文提出了一种改进的Pattern-Exploiting Training(PET)方法,使小型语言模型(如ALBERT)在仅拥有GPT-3约千分之一参数量的情况下,仍能实现与GPT-3相当的 few-shot 学习性能。通过将任务重新表述为包含多种模式的完形填空问题,并在标注数据上使用基于梯度的微调,该方法在 SuperGLUE 数据集上实现了最先进的结果,同时显著降低了计算和环境成本。
When scaled to hundreds of billions of parameters, pretrained language models such as GPT-3 (Brown et al., 2020) achieve remarkable few-shot performance. However, enormous amounts of compute are required for training and applying such big models, resulting in a large carbon footprint and making it difficult for researchers and practitioners to use them. We show that performance similar to GPT-3 can be obtained with language models that are much "greener" in that their parameter count is several orders of magnitude smaller. This is achieved by converting textual inputs into cloze questions that contain a task description, combined with gradient-based optimization; exploiting unlabeled data gives further improvements. We identify key factors required for successful natural language understanding with small language models.
研究动机与目标
- 使小型语言模型在无需大规模参数量或过度计算资源的情况下实现 few-shot 学习。
- 通过用更小、更高效的替代模型取代 GPT-3 等大模型,减少 few-shot NLP 的环境影响。
- 探究在使用结构化提示和微调时,小型模型是否能够匹配 GPT-3 等大模型的 few-shot 泛化能力。
- 识别使小型模型实现高性能的关键因素,包括模式多样性、对措辞变化的鲁棒性,以及对标注数据的有效利用。
提出的方法
- 通过将解码策略修改为基于概率得分按顺序预测 token(即 max-first 解码),使 PET 能够处理多 token 输出。
- 使用掩码语言模型(如 ALBERT)计算完形填空式提示中候选答案的概率,其中输入被转换为填空问题。
- 采用多种模式(PVPs)重述输入和输出,使模型能够从多样化表述中学习,提升泛化能力。
- 使用标注样本进行基于梯度的微调,并通过来自更大教师模型的知识蒸馏来提升性能。
- 在自训练设置中利用未标注数据,进一步提升性能,尤其在标注数据稀缺时效果显著。
- 实施迭代 PET(iPET),通过多轮模式应用和模型更新来优化预测结果。
实验结果
研究问题
- RQ1小型语言模型是否能在不依赖大规模参数量的情况下,实现与 GPT-3 相当的 few-shot 性能?
- RQ2为支持 few-shot 学习中的多 token 输出预测,PET 需要进行哪些修改?
- RQ3模式多样性、标注效率和模型架构等因素如何影响小型模型的性能?
- RQ4未标注数据和知识蒸馏在多大程度上能提升小型模型的 few-shot 性能?
- RQ5训练样本的选择是否显著影响性能?与 GPT-3 等基于提示的方法相比有何差异?
主要发现
- 使用改进 PET 方法微调的 ALBERT 模型在 SuperGLUE 上的表现优于 GPT-3,仅使用 32 个训练样本,平均性能达到 87.1%,而 GPT-3 为 65.4%。
- 改进的 PET 方法在 SuperGLUE 上实现了最先进结果,所用模型参数量仅为 GPT-3 的 0.1%(约 1 亿 vs. 1750 亿)。
- 对于多 token 输出,max-first 解码优于自左向右和并行解码策略,尤其在 COPA 和 ReCoRD 等任务上表现更优。
- 不同随机种子下训练数据的性能差异显著,凸显了在比较 few-shot 方法时使用一致训练集的重要性。
- 即使不使用知识蒸馏或未标注数据,仅使用 ALBERT 的 PET 方法也表现出强劲性能,表明该方法在数据和计算资源极少时依然有效。
- 该方法显著降低了环境影响,训练可在单张 GPU 上数小时内完成,远低于 GPT-3 所需的巨大计算资源。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。