[论文解读] Transformers generalize differently from information stored in context vs in weights
本文研究了Transformer模型在从权重内信息与上下文信息中泛化时的差异,发现虽然小模型以基于样本的方式从上下文进行泛化,但大语言模型则表现出强烈的基于规则的上下文泛化——表明规模与语言数据的组合结构共同促成了类规则的上下文学习。在基于规则的数据上进行预训练也能诱导此类行为,表明大规模语言模型中存在涌现的归纳偏置。
Transformer models can use two fundamentally different kinds of information: information stored in weights during training, and information provided ``in-context'' at inference time. In this work, we show that transformers exhibit different inductive biases in how they represent and generalize from the information in these two sources. In particular, we characterize whether they generalize via parsimonious rules (rule-based generalization) or via direct comparison with observed examples (exemplar-based generalization). This is of important practical consequence, as it informs whether to encode information in weights or in context, depending on how we want models to use that information. In transformers trained on controlled stimuli, we find that generalization from weights is more rule-based whereas generalization from context is largely exemplar-based. In contrast, we find that in transformers pre-trained on natural language, in-context learning is significantly rule-based, with larger models showing more rule-basedness. We hypothesise that rule-based generalization from in-context information might be an emergent consequence of large-scale training on language, which has sparse rule-like structure. Using controlled stimuli, we verify that transformers pretrained on data containing sparse rule-like structure exhibit more rule-based generalization.
研究动机与目标
- 理解Transformer在从权重内信息与上下文信息中泛化时的归纳偏置。
- 比较不同训练范式下基于规则与基于样本的泛化模式。
- 研究并探讨在自然语言数据上进行预训练是否以及如何在大模型中诱导出基于规则的上下文泛化。
- 确定模型规模与数据结构是否共同塑造了上下文学习行为。
- 评估是否可通过特定预训练克服基于样本的上下文泛化。
提出的方法
- 采用部分暴露范式以区分基于规则与基于样本的泛化,即模型根据最小规则或与训练样本的相似性对保留的刺激进行分类。
- 使用包含双特征刺激的合成数据集从零开始训练Transformer,标签由某一特征(如颜色或形状)决定,从而实现对权重内与上下文学习的受控比较。
- 在相同的部分暴露任务上评估预训练语言模型(如LLaMA)的上下文泛化行为。
- 将规则性量化为在部分暴露条件与对照条件之间,沿预测特征(如形状或颜色)的分类准确率提升。
- 通过改变模型规模、架构深度、注意力头数量以及训练数据分布,隔离影响泛化风格的因素。
- 设计了一种合成数据集的变体,明确要求在预训练期间必须进行基于规则的泛化,以测试此类数据是否能克服默认的基于样本的偏置。
实验结果
研究问题
- RQ1在受控的合成环境中,Transformer如何从权重内信息与上下文信息中进行泛化?
- RQ2在小规模、从零开始训练的Transformer中,上下文学习是否更倾向于基于样本或基于规则的泛化?
- RQ3大预训练语言模型在在上下文信息中表现出基于规则的泛化程度如何?
- RQ4在基于规则的合成数据上进行预训练是否能诱导Transformer在上下文中实现基于规则的泛化?
- RQ5模型规模在促成语言模型中基于规则的上下文泛化中起到何种作用?
主要发现
- 在从零开始训练的Transformer中,从权重内信息的泛化完全基于规则,而从上下文信息的泛化主要基于样本。
- 大预训练语言模型(如7B–70B参数模型)在上下文学习中表现出显著更多的基于规则的泛化,且规则性随模型规模增加而提升。
- 较小的语言模型(1B和7B参数)在上下文学习中几乎完全表现为基于样本的泛化,与从零开始训练的模型相似。
- 当在要求基于规则分类的合成数据上进行预训练时,Transformer能够学会从上下文进行基于规则的泛化,表明基于样本的偏置并非固有,而是可以被克服。
- 大语言模型中向基于规则的上下文泛化转变,很可能是由自然语言数据的组合性、类规则结构以及模型规模共同驱动的。
- 对照条件基线表明,模型默认倾向于沿颜色进行泛化,但当存在稀疏规则(如形状)作为预测特征时,该偏好会被覆盖。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。