Skip to main content
QUICK REVIEW

[论文解读] Few-shot Fine-tuning vs. In-context Learning: A Fair Comparison and Evaluation

Marius Mosbach, Tiago Pimentel|arXiv (Cornell University)|May 26, 2023
Topic Modeling被引用 6
一句话总结

本文使用 OPT 和 Pythia 模型在 125M 到 30B 参数范围内,对少样本微调(FT)与上下文学习(ICL)进行了公平、模型尺寸可控的对比研究。研究发现,当模型参数量相当时,FT 在分布外数据上的泛化能力与 ICL 相当,挑战了此前认为 ICL 天生更具鲁棒性的观点,并指出两种方法均不稳定,且对数据、提示设计和模型规模高度敏感。

ABSTRACT

Few-shot fine-tuning and in-context learning are two alternative strategies for task adaptation of pre-trained language models. Recently, in-context learning has gained popularity over fine-tuning due to its simplicity and improved out-of-domain generalization, and because extensive evidence shows that fine-tuned models pick up on spurious correlations. Unfortunately, previous comparisons of the two approaches were done using models of different sizes. This raises the question of whether the observed weaker out-of-domain generalization of fine-tuned models is an inherent property of fine-tuning or a limitation of the experimental setup. In this paper, we compare the generalization of few-shot fine-tuning and in-context learning to challenge datasets, while controlling for the models used, the number of examples, and the number of parameters, ranging from 125M to 30B. Our results show that fine-tuned language models can in fact generalize well out-of-domain. We find that both approaches generalize similarly; they exhibit large variation and depend on properties such as model size and the number of examples, highlighting that robust task adaptation remains a challenge.

研究动机与目标

  • 为解决关于上下文学习(ICL)在分布外泛化方面优于微调(FT)的相互矛盾的主张,通过消除模型尺寸等混淆因素。
  • 探究观察到的 ICL 与 FT 之间泛化差距是否源于微调的固有局限性,或源于先前研究中的实验设计缺陷。
  • 评估在不同模型尺寸(125M 到 30B)和少样本数据设置(16 个和 128 个样本)下,FT 和 ICL 的稳定性和性能表现。
  • 评估提示设计、数据选择和模型规模对两种微调策略泛化行为的影响。
  • 基于受控条件下的实证结果,提供关于何时以及如何有效使用 FT 或 ICL 的可操作见解。

提出的方法

  • 在多个尺寸(125M 到 30B)的 OPT 和 Pythia 模型上进行实验,以确保模型尺寸为受控变量。
  • 采用基于模式的微调(PBFT),使用固定输入模式和词元化器,以标准化微调过程。
  • 采用包含 16 个样本演示的上下文学习,并使用三种提示模式(最小模式、gpt-3 模式、eval-harness 模式)以确保 ICL 设置的一致性。
  • 在 RTE 和 MNLI 数据集上进行训练和评估,每个实验使用 10 个随机数据种子以评估稳定性。
  • 基于域内和域外性能选择模型检查点,以评估泛化鲁棒性。
  • 对 ICL 与 FT 之间的性能差异进行 Welch’s t 检验,以确定在不同模型尺寸和数据设置下结果的统计显著性。

实验结果

研究问题

  • RQ1当模型尺寸相等时,微调在分布外数据上的泛化能力是否与上下文学习相当?
  • RQ2模型尺寸如何影响微调与上下文学习的泛化性能?
  • RQ3少样本示例数量(16 个 vs. 128 个)在两种微调策略的稳定性和性能中起到什么作用?
  • RQ4微调与上下文学习对提示设计和数据选择策略的敏感性如何?
  • RQ5先前观察到的 ICL 相对于微调的优越性,是源于内在优势,还是源于模型尺寸差异带来的实验偏差?

主要发现

  • 当模型尺寸相等时,少样本微调在分布外数据上的泛化能力与上下文学习相当,挑战了 ICL 具有固有鲁棒性的先前观点。
  • 使用仅 16 个样本时,6.7B 参数的微调模型性能可与 30B 参数的上下文学习模型相媲美,表明模型规模在先前比较中起到了决定性影响。
  • 两种方法在不同随机种子下均表现出高度不稳定性,域内和域外性能存在显著差异。
  • 随着模型规模增大,两种方法的性能均有所提升;在所测试的模型和数据集上,微调的泛化能力通常优于上下文学习。
  • 提示模式的选择以及数据选择策略(例如,选择域内最佳或域外最佳检查点)对性能有显著影响,尤其在微调中更为明显。
  • 在使用 16 个样本和最优检查点选择时,大多数模型尺寸下,ICL 与 FT 在 RTE 数据集上的性能差异无统计学显著性,表明在公平条件下两者具有相当的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。