[论文解读] Uncontrolled Lexical Exposure Leads to Overestimation of Compositional Generalization in Pretrained Models
本文表明,预训练语言模型在组合泛化能力上存在高估,这是由于预训练过程中词汇暴露不受控制所致。通过在 COGS 基准测试中用新颖的字符序列或唯一嵌入替换上下文控制的词汇项,作者发现性能显著下降——最高达 51 个百分点,揭示了先前结果因预训练数据中罕见词汇的暴露而被夸大。
Human linguistic capacity is often characterized by compositionality and the generalization it enables -- human learners can produce and comprehend novel complex expressions by composing known parts. Several benchmarks exploit distributional control across training and test to gauge compositional generalization, where certain lexical items only occur in limited contexts during training. While recent work using these benchmarks suggests that pretrained models achieve impressive generalization performance, we argue that exposure to pretraining data may break the aforementioned distributional control. Using the COGS benchmark of Kim and Linzen (2020), we test two modified evaluation setups that control for this issue: (1) substituting context-controlled lexical items with novel character sequences, and (2) substituting them with special tokens represented by novel embeddings. We find that both of these setups lead to lower generalization performance in T5 (Raffel et al., 2020), suggesting that previously reported results have been overestimated due to uncontrolled lexical exposure during pretraining. The performance degradation is more extreme with novel embeddings, and the degradation increases with the amount of pretraining data, highlighting an interesting case of inverse scaling.
研究动机与目标
- 调查预训练期间不受控制的词汇暴露是否破坏了组合泛化基准所假设的分布控制。
- 评估在 COGS 等基准测试中报告的预训练模型高泛化性能是否因预训练数据中罕见词汇项的暴露而人为夸大。
- 提出并测试两种改进的评估设置,以实现更严格的词汇控制,从而获得更可靠的泛化得分。
- 研究词汇替换策略(字符序列 vs. 新增嵌入)对模型性能及泛化鲁棒性的影响。
- 挑战预训练普遍提升组合泛化能力的假设,特别是在包含罕见词汇项的零样本或少样本设置下。
提出的方法
- 在 COGS 基准测试中,将上下文控制的词汇项(如 'hedgehog')替换为预训练语料库中不存在的新字符序列。
- 将相同的词汇项替换为经过全新随机初始化的特殊标记嵌入,且不与任何预训练数据共享。
- 在两种替换策略下,使用与原始基准测试相同的训练和评估协议,对 T5 模型在修改后的 COGS 数据集上进行微调。
- 将 T5 模型在修改后数据集上的泛化准确率与在原始 COGS 基准测试中的表现进行比较。
- 将性能下降程度作为词汇暴露不受控制导致高估的指标。
- 通过比较在不断增加规模的预训练数据上微调的模型之间的性能下降,分析预训练数据规模的影响。
实验结果
研究问题
- RQ1预训练期间不受控制的词汇暴露在多大程度上导致了预训练模型对组合泛化能力的高估?
- RQ2与原始基准测试相比,将上下文控制的词汇项替换为新颖字符序列对泛化性能有何影响?
- RQ3使用全新、随机初始化的嵌入表示词汇项对泛化性能有何影响,与字符序列替换相比如何?
- RQ4性能下降程度是否随预训练数据规模而变化?如果是,这说明了预训练在组合泛化中的作用是什么?
- RQ5在何种条件下预训练无法提升组合泛化能力,甚至可能造成损害?
主要发现
- 将上下文控制的词汇项替换为新颖字符序列后,T5 在 COGS 上的泛化准确率从 83% 下降至 64% 至 69%,表明存在 14 至 19 个百分点的高估。
- 使用全新嵌入表示词汇项导致性能最高下降 51 个百分点,准确率从 83% 降至最低 32%,揭示了因词汇暴露不受控制而造成的严重高估。
- 在全新嵌入设置中,随机初始化的模型表现优于预训练模型,表明当词汇项未得到适当控制时,预训练可能对泛化能力产生负面影响。
- 与字符序列相比,使用全新嵌入导致的性能下降更严重,表明嵌入与预训练数据的相似性在高估中起着关键作用。
- 性能下降的幅度随预训练数据量的增加而增大,揭示了一种反向缩放效应:更大的预训练数据加剧了高估现象。
- 这些结果表明,先前关于预训练模型在组合泛化方面表现强劲的报告,很可能因在 C4 等预训练语料库中接触到了罕见词汇项而被夸大。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。