[论文解读] The Inductive Bias of In-Context Learning: Rethinking Pretraining Example Design
本文识别出一种在上下文学习中的归纳偏置,即神经语言模型(NLMs)在同一个预训练样本中呈现的句子之间会学习到更强的依赖关系,而来自不同样本的句子之间的依赖关系则较弱。通过分离秩分析形式化这一偏置,作者提出了kNN-Pretraining——将语义相关但非相邻的句子整合进同一训练样本中——从而提升句子表征能力,并在开放域问答和GLUE基准上实现更好的零样本性能。
Pretraining Neural Language Models (NLMs) over a large corpus involves chunking the text into training examples, which are contiguous text segments of sizes processable by the neural architecture. We highlight a bias introduced by this common practice: we prove that the pretrained NLM can model much stronger dependencies between text segments that appeared in the same training example, than it can between text segments that appeared in different training examples. This intuitive result has a twofold role. First, it formalizes the motivation behind a broad line of recent successful NLM training heuristics, proposed for the pretraining and fine-tuning stages, which do not necessarily appear related at first glance. Second, our result clearly indicates further improvements to be made in NLM pretraining for the benefit of Natural Language Understanding tasks. As an example, we propose "kNN-Pretraining": we show that including semantically related non-neighboring sentences in the same pretraining example yields improved sentence representations and open domain question answering abilities. This theoretically motivated degree of freedom for pretraining example design indicates new training schemes for self-improving representations.
研究动机与目标
- 将预训练数据分割为连续训练样本所引入的归纳偏置形式化。
- 量化建模从未在同一输入中共同出现的句子之间依赖关系的表达能力缺陷。
- 证明该偏置支撑了多种成功的NLP训练启发式方法,并限制了跨样本信息整合。
- 提出并评估kNN-Pretraining方法,通过将语义相关但非相邻的句子包含在同一训练样本中,以缓解该偏置。
- 通过实证结果表明,kNN-Pretraining可提升开放域问答和GLUE基准上的零样本性能。
提出的方法
- 引入‘上下文偏置’概念——一种形式化的表达能力偏置,偏好在训练样本中共同出现的句子之间的依赖关系。
- 定义ε-分离秩为在有限精度下有效依赖建模能力的度量,并将其适配于序列化、多样本设置。
- 将同一输入中两个句子的对数分离秩上界定为Õ(dxL),其中dx为模型宽度,L为深度,证明该上界是紧的。
- 将从未共同出现的两个句子的对数分离秩上界定为Õ(dx[L − 0.5 log₃(η⁻¹)]), 揭示了由于学习率较小而产生的深度缺陷。
- 提出kNN-Pretraining:重新格式化预训练数据,将语义相似但非相邻的句子整合进同一输入样本中。
- 使用kNN-Pretraining在Wikipedia数据上训练RoBERTa和GPT-2模型,采用混合数据流和标准语言建模目标,并在Natural Questions和GLUE基准上进行评估。
实验结果
研究问题
- RQ1将预训练语料库分割为连续训练样本,如何影响模型学习跨样本依赖关系的能力?
- RQ2建模从未在同一输入中共同出现的句子之间的依赖关系,其理论表达能力代价是什么?
- RQ3将语义相关但非相邻的句子整合进同一训练样本,能否提升下游NLU性能?
- RQ4kNN-Pretraining在多大程度上提升了开放域问答和泛化任务的零样本能力?
- RQ5依赖建模中的深度缺陷如何随学习率和模型规模变化?
主要发现
- 由于学习率较小(η ∈ [10⁻⁶, 10⁻⁴]),模型在建模来自不同训练样本的句子之间的依赖关系时,理论上受到约6层的深度缺陷限制。
- 在Natural Questions基准上,kNN-Pretraining显著提升了零样本性能,345M参数模型在40万次常规训练步骤外加1万次kNN-Pretraining步骤后,F1分数达到1.4×10⁻²。
- 在GLUE任务上,kNN-Pretraining将零样本准确率从基线的35.1提升至35.5(MNLI),52.0提升至53.0(RTE),51.1提升至56.3(WNLI)。
- kNN-Pretraining的性能提升在仅使用总预训练时间10%时最为显著,表明其具有很高的样本效率。
- 深度缺陷的估计可能比理论界限更为严重,可能与L成分数比例缩放,表明其在实际中具有更强的影响。
- 实证结果表明,即使在零样本设置下,kNN-Pretraining也能增强模型能力,表明通过结构化的上下文暴露,内部表征学习得到了改善。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。