[论文解读] Large GPT-like Models are Bad Babies: A Closer Look at the Relationship between Linguistic Competence and Psycholinguistic Measures
本研究在 BabyLM 语料库上训练类 GPT 语言模型,以考察语言能力与心理语言学合理性之间的权衡。结果表明,尽管更大的模型在形式和功能性语言任务(BLiMP、GLUE、MSGS)上表现更优,但在预测自定速阅读时间方面表现更差——最小的模型与心理语言学数据的拟合度最佳,表明在扩大语言模型规模与以发展上合理的方式建模处理负担之间存在根本性不相容性。
Research on the cognitive plausibility of language models (LMs) has so far mostly concentrated on modelling psycholinguistic response variables such as reading times, gaze durations and N400/P600 EEG signals, while mostly leaving out the dimension of what Mahowald et al. (2023) described as formal and functional linguistic competence, and developmental plausibility. We address this gap by training a series of GPT-like language models of different sizes on the strict version of the BabyLM pretraining corpus, evaluating on the challenge tasks (BLiMP, GLUE, MSGS) and an additional reading time prediction task. We find a positive correlation between LM size and performance on all three challenge tasks, with different preferences for model width and depth in each of the tasks. In contrast, a negative correlation was found between LM size and reading time fit of linear mixed-effects models using LM surprisal as a predictor, with the second-smallest LM achieving the largest log-likelihood reduction over a baseline model without surprisal. This suggests that modelling processing effort and linguistic competence may require an approach different from training GPT-like LMs on a developmentally plausible corpus.
研究动机与目标
- 探究在发展上合理的语料上训练的大规模类 GPT 语言模型是否能同时实现高水平的语言能力与认知合理性。
- 评估模型规模与在形式语言能力任务(BLiMP、GLUE、MSGS)与心理语言学测量(阅读时间预测)上的表现之间的关系。
- 评估语言模型意外度(surprisal)是否与实际人类阅读时间相关,尤其是在不同模型规模下。
- 探讨观察到的语言能力与处理负担建模之间的脱节对今后认知上合理的语言模型设计的启示。
- 确定在特定领域、面向儿童的语料上进行训练,是否能比在更大规模的一般领域数据集上实现更好的与人类处理机制的对齐。
提出的方法
- 在 BabyLM 预训练语料的严格版本上,训练了一系列参数规模各异(从 <5M 到 ~100M 参数)的仅解码器结构 Transformer 语言模型。
- 在三个基准任务上评估模型:BLiMP(形式语言能力)、GLUE(功能性语言能力)和 MSGS(句法泛化能力)。
- 使用标准 NLP 指标(如准确率、F1)和在 BabyLM 开发集上的困惑度来衡量模型表现。
- 通过将语言模型意外度作为自定速阅读时间的预测变量,使用线性混合效应模型评估心理语言学合理性。
- 通过比较基准模型(无意外度)与包含意外度的模型之间的对数似然差值来量化模型拟合度,Δlog-likelihood 越高表示预测能力越强。
- 使用斯皮尔曼等级相关系数分析模型规模、困惑度以及在语言和心理语言学任务上的表现之间的关系。
实验结果
研究问题
- RQ1当在发展上合理的语料上训练时,增加模型规模是否能提升在形式和功能性语言能力基准(BLiMP、GLUE、MSGS)上的表现?
- RQ2语言模型规模与语言模型意外度预测人类自定速阅读时间的能力之间是否存在相关性?
- RQ3在面向儿童的语料上训练的大规模类 GPT 模型能否同时实现高水平的语言能力和强大的心理语言学合理性?
- RQ4语言模型的规模是否会影响意外度对实证阅读时间数据的拟合度,如果是,其影响机制如何?
- RQ5训练语料(如 BabyLM 与 Wikitext-103)在促进或阻碍语言模型意外度与阅读时间之间相关性方面起到何种作用?
主要发现
- 更大的类 GPT 模型在 BLiMP、GLUE 和 MSGS 上表现出与模型规模正相关的性能,且性能随模型规模单调递增。
- 参数量小于 500 万的模型在自定速阅读时间数据上的拟合度最佳,相对于基准模型使对数似然降低的幅度最大。
- 模型规模与阅读时间预测拟合度之间存在负相关关系,第二小的模型在 Δlog-likelihood 改进上达到最高值。
- 语言模型困惑度与阅读时间拟合度之间的斯皮尔曼等级相关系数为负(ρ = -0.4784,p < 0.05),表明较低的困惑度与较差的人类阅读时间预测能力相关。
- 尽管 BabyLM 语料比 Wikitext-103 更小,但其在意外度与阅读时间之间建立了更强的相关性,表明语料的特定属性可能有助于实现这种学习。
- 结果表明,通过意外度建模处理负担与实现语言能力,可能需要与标准 GPT 风格预训练截然不同的训练范式或架构选择。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。