[论文解读] Different kinds of cognitive plausibility: why are transformers better than RNNs at predicting N400 amplitude?
本研究探讨了为何变换器语言模型(T-LMs)在预测N400振幅——一种语义加工难度的神经标志——方面优于循环神经网络语言模型(RNN-LMs)。通过使用GPT-2和自定义的J型RNN(JRNN),作者发现T-LMs更能捕捉语义促进效应,其意外度分数与上下文词和目标词之间的语义相似性相关性更强,表明变换器隐式地模拟了类似于人类认知的激活扩散机制。
Despite being designed for performance rather than cognitive plausibility, transformer language models have been found to be better at predicting metrics used to assess human language comprehension than language models with other architectures, such as recurrent neural networks. Based on how well they predict the N400, a neural signal associated with processing difficulty, we propose and provide evidence for one possible explanation - their predictions are affected by the preceding context in a way analogous to the effect of semantic facilitation in humans.
研究动机与目标
- 确定变换器语言模型(T-LMs)是否在预测N400振幅方面优于RNN-LMs,特别是与语义促进效应的关系。
- 探究T-LMs在预测N400方面表现更优的原因是否在于其能够捕捉上下文词与目标词之间的语义相似性,类似于人类的语义启动效应。
- 评估T-LMs与RNN-LMs之间的架构差异——特别是注意力机制与循环状态——是否导致其在意外度预测中表现出不同的语义促进模式。
- 通过展示T-LMs更能建模诸如语义启动等神经认知现象,挑战RNN-LMs因工作记忆有限而更具认知合理性的假设。
- 澄清不同神经网络架构在建模人类语言理解方面的认知合理性,特别是关于预测和语义相关性对N400的调制作用。
提出的方法
- 在相同文本语料上训练GPT-2语言模型和自定义的J型RNN(JRNN),以确保训练数据的一致性。
- 计算每个模型的与N400相关的意外度,即给定上下文后目标词的负对数概率。
- 使用预训练词嵌入之间的余弦距离计算目标词与前序上下文词之间的语义相似性。
- 使用线性混合效应模型检验意外度和语义相似性在预测EEG数据中N400振幅方面的表现。
- 比较GPT-2和JRNN意外度对N400振幅的预测能力,特别区分语义相关与无关的目标词。
- 分析模型意外度与语义相似性之间的相关性,以评估模型是否隐式编码了激活扩散效应。
实验结果
研究问题
- RQ1变换器语言模型(T-LMs)的意外度是否比RNN-LMs更能预测N400振幅?
- RQ2T-LMs与RNN-LMs在多大程度上捕捉了语义促进效应,该效应以上下文与目标词之间的语义相似性为指标?
- RQ3T-LMs与RNN-LMs的模型意外度与语义相似性之间是否存在显著相关性,这种相关性如何影响N400振幅的预测?
- RQ4T-LMs与RNN-LMs之间的架构差异是否可以解释其在建模神经认知现象(如N400调制)方面的表现差异?
- RQ5T-LMs通过注意力机制隐式建模激活扩散效应的能力,是否使其在语言理解的某些方面比RNN-LMs更具认知合理性?
主要发现
- GPT-2的意外度在预测N400振幅方面显著优于JRNN的意外度,尤其在与最高补全概率词语义相关的词上表现更优。
- 与JRNN相比,GPT-2的意外度与上下文和目标词之间语义相似性的负相关性更强,表明T-LMs更能将语义上下文整合到预测中。
- 在高补全概率的上下文中,JRNN的意外度难以区分语义相关与无关的目标词,表明其对语义促进效应的敏感性较低。
- 结果表明,T-LMs通过其注意力机制隐式地模拟了激活扩散效应,即使该功能并非其架构的显式设计目标。
- 尽管RNN-LMs具有更有限的工作记忆,且在直觉上更符合认知模型,但T-LMs更能捕捉N400反应中的神经认知现象,如语义启动。
- 研究结果表明,认知合理性不应仅依据模型架构与人类工作记忆的相似性来判断,还应考虑其复制关键神经认知动态(如语义促进)的能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。