[论文解读] Why Does Surprisal From Larger Transformer-Based Language Models Provide a Poorer Fit to Human Reading Times?
本研究探究为何参数更大、困惑度更低的基于Transformer的预训练语言模型会产生与人类阅读时间预测能力较差的意外度估计。通过在GPT-Neo与OPT模型上进行回归分析与残差误差分析,发现更大的模型会系统性地低估开放类词(尤其是命名实体)的阅读时间,原因在于对训练数据的过度记忆,表明尽管困惑度提升,其认知合理性随规模增加而下降。
This work presents a detailed linguistic analysis into why larger Transformer-based pre-trained language models with more parameters and lower perplexity nonetheless yield surprisal estimates that are less predictive of human reading times. First, regression analyses show a strictly monotonic, positive log-linear relationship between perplexity and fit to reading times for the more recently released five GPT-Neo variants and eight OPT variants on two separate datasets, replicating earlier results limited to just GPT-2 (Oh et al., 2022). Subsequently, analysis of residual errors reveals a systematic deviation of the larger variants, such as underpredicting reading times of named entities and making compensatory overpredictions for reading times of function words such as modals and conjunctions. These results suggest that the propensity of larger Transformer-based models to 'memorize' sequences during training makes their surprisal estimates diverge from humanlike expectations, which warrants caution in using pre-trained language models to study human language processing.
研究动机与目标
- 探究为何更大的、困惑度更低的基于Transformer的语言模型会产生对人类阅读时间预测能力较差的意外度估计。
- 检验反直觉趋势(即模型容量越高,预测拟合效果越差)是否在GPT-2以外的多种模型家族中依然成立。
- 通过残差误差分析,识别出在哪些具体语言现象上,大模型与人类阅读行为产生偏离。
- 挑战NLP领域中‘越大越好’的普遍假设,证明模型规模会损害处理模型的认知合理性。
- 倡导在心理语言学建模中使用更小的预训练语言模型作为更可靠的基线。
提出的方法
- 对五种GPT-Neo与八种OPT变体进行回归分析,评估语言模型困惑度与意外度对人类阅读时间预测拟合度之间的关系。
- 使用两个独立的自然主义阅读数据集,以确保观察到的趋势具有稳健性。
- 进行残差误差分析,识别意外度预测中的系统性偏差,重点关注名词、形容词、情态动词和连词等词类。
- 将较大模型(如GPT-Neo 2.7B)与较小模型(如GPT-Neo 125M)的意外度估计进行比较,以隔离模型规模对预测准确度的影响。
- 分析残差误差中的语言模式,判断低估是否集中于命名实体等开放类词,而高估是否集中于功能词。
- 以统计严谨性复制并扩展Oh等人(2022)的先前发现,覆盖更广泛的模型架构,包括非GPT-2架构。
实验结果
研究问题
- RQ1在多个基于Transformer的语言模型家族中,语言模型困惑度与对人类阅读时间拟合度之间是否存在正向对数线性关系?
- RQ2为何参数更大、困惑度更低的语言模型会产生对人类阅读时间预测能力较差的意外度估计?
- RQ3哪些语言类别在大模型与小模型的意外度预测中表现出最显著的偏离?
- RQ4模型对训练序列的记忆程度在多大程度上扭曲了意外度估计,使其偏离人类处理预期?
- RQ5通过使用更小的模型而非更大的模型,能否改善语言模型意外度的认知合理性?
主要发现
- 在两个数据集上,对五种GPT-Neo与八种OPT变体的分析表明,语言模型困惑度与对人类阅读时间的拟合度之间存在严格单调的正对数线性关系。
- 更大的模型系统性地低估了命名实体及其他开放类词的阅读时间,且低估程度随模型规模增加而加剧。
- 在情态动词和连词等功能词上观察到补偿性高估,表明处理负荷估计发生了偏移。
- 对开放类词的阅读时间低估表明,大模型因对训练序列的广泛记忆,人为地赋予这些词过低的意外度。
- 这些结果表明,尽管困惑度更低、语言建模性能更优,大模型在处理难度估计上已偏离人类认知预期。
- 研究结果挑战了‘大模型更优’的认知建模假设,主张使用更小的预训练模型作为更可靠的基线。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。