[论文解读] Are Larger Pretrained Language Models Uniformly Better? Comparing Performance at the Instance Level
本文研究了在整体准确率提升的前提下,更大的预训练语言模型是否在实例层面也始终优于较小的模型。通过采用统计严谨的方法来控制预训练和微调过程中的噪声,作者发现 BERT-large 在 MNLI、SST-2 和 QQP 数据集上至少有 1–4% 的实例表现不如 BERT-mini,这挑战了模型规模越大性能越优的普遍假设。
Larger language models have higher accuracy on average, but are they better on every single instance (datapoint)? Some work suggests larger models have higher out-of-distribution robustness, while other work suggests they have lower accuracy on rare subgroups. To understand these differences, we investigate these models at the level of individual instances. However, one major challenge is that individual predictions are highly sensitive to noise in the randomness in training. We develop statistically rigorous methods to address this, and after accounting for pretraining and finetuning noise, we find that our BERT-Large is worse than BERT-Mini on at least 1-4% of instances across MNLI, SST-2, and QQP, compared to the overall accuracy improvement of 2-10%. We also find that finetuning noise increases with model size and that instance-level accuracy has momentum: improvement from BERT-Mini to BERT-Medium correlates with improvement from BERT-Medium to BERT-Large. Our findings suggest that instance-level predictions provide a rich source of information; we therefore, recommend that researchers supplement model weights with model predictions.
研究动机与目标
- 确定更大的预训练语言模型是否在实例层面始终优于较小的模型,而不仅限于整体准确率的比较。
- 解决预训练和微调过程中因随机种子导致的预测噪声问题,该噪声会掩盖真实模型性能的差异。
- 开发一种统计上稳健的方法来估计实例层面的准确率,同时考虑训练过程中的随机性。
- 探究在不同模型规模下,实例层面的性能表现是否呈现出动量或方差模式。
- 建议研究人员在发布模型权重的同时,也公开模型预测结果,以支持对模型行为的更深入分析。
提出的方法
- 使用不同的随机种子预训练 10 个每种规模(mini、base、large)的 BERT 模型,以控制预训练噪声的影响。
- 对每个预训练好的模型分别进行 5 次微调,每次使用不同的随机种子,以控制微调噪声,生成一个四维预测张量(模型规模、样本实例、预训练种子、微调种子)。
- 通过蒙特卡洛平均法,估计实例层面准确率,即在所有随机种子下正确预测的期望比例。
- 构建一个随机基线,用于估计在识别较小模型优于较大模型的实例时,假阳性发现率的水平。
- 采用一种改进的统计程序(优于传统的 Benjamini-Hochberg 方法结合 Fisher 精确检验),以对实例层面比较中的假发现数进行上界控制。
- 通过方差成分分析,将预测变异归因于预训练种子或微调种子,并考察不同模型规模间性能提升的动量特征。
实验结果
研究问题
- RQ1更大的预训练语言模型是否在实例层面始终优于较小的模型,还是在某些特定输入上表现更差?
- RQ2观察到的不同模型规模之间的性能差异中,有多少是由于预训练和微调过程中的随机噪声造成的,而非真实模型能力的差异?
- RQ3从较小模型到更大模型的性能提升是否在实例层面表现出动量特征,即从 BERT-mini 到 BERT-medium 提升的模型,是否也更可能从 BERT-medium 到 BERT-large 继续提升?
- RQ4模型预测的方差如何随模型规模变化?是预训练种子还是微调种子对这种方差的贡献更大?
- RQ5哪些类型的实例(如罕见、有争议或模糊的)更可能被更大的模型错误分类?
主要发现
- 尽管整体准确率提升了 2–10%,BERT-large 在 MNLI、SST-2 和 QQP 数据集上至少有 1–4% 的实例表现不如 BERT-mini。
- 观察到较大模型表现更差的实例比例显著高于随机预期,该结论通过严格的随机基线和统计校正得到验证。
- 实例层面的准确率提升表现出动量特征:在从 BERT-mini 到 BERT-medium 提升的模型,也更可能在从 BERT-medium 到 BERT-large 的过程中继续提升。
- 微调噪声随模型规模增大而增加,对预测方差的贡献大于预训练噪声,尤其在大模型中更为显著。
- 较大模型表现更差的实例集合中,既包括有争议或模糊的标签,也包括正确标注的样本,表明其失败案例并无简单模式可循。
- 本研究建议研究人员在发布模型权重的同时,也公开模型预测结果,以支持对模型行为在实例层面的细粒度分析。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。