[论文解读] Long-range and hierarchical language predictions in brains and algorithms
本研究揭示,在自然语言理解过程中,人类大脑在预测远距离、分层语言结构方面优于当前最先进深度语言模型。基于304名受试者的fMRI数据,作者证明大脑活动可编码长达8个词前的长程句法与语义预测,而GPT-2模型尽管与大脑激活线性映射,却无法捕捉此类长程依赖关系。
Deep learning has recently made remarkable progress in natural language processing. Yet, the resulting algorithms remain far from competing with the language abilities of the human brain. Predictive coding theory offers a potential explanation to this discrepancy: while deep language algorithms are optimized to predict adjacent words, the human brain would be tuned to make long-range and hierarchical predictions. To test this hypothesis, we analyze the fMRI brain signals of 304 subjects each listening to 70min of short stories. After confirming that the activations of deep language algorithms linearly map onto those of the brain, we show that enhancing these models with long-range forecast representations improves their brain-mapping. The results further reveal a hierarchy of predictions in the brain, whereby the fronto-parietal cortices forecast more abstract and more distant representations than the temporal cortices. Overall, this study strengthens predictive coding theory and suggests a critical role of long-range and hierarchical predictions in natural language processing.
研究动机与目标
- 探究人类大脑是否在超出即时上下文的范围内进行长程且分层的语言预测,而当前深度学习模型不具备此能力。
- 检验大脑预测编码支持远距离、结构化预测的假设,而语言模型仅限于短程预测。
- 通过fMRI与模型激活分析,量化并比较人类大脑与深度神经网络在语言预测中的深度与距离。
- 将大脑预测分解为句法与语义成分,评估其在长程预测中的各自贡献。
- 评估通过引入长程预测表示增强语言模型后,是否能提升其与人类大脑活动的一致性。
提出的方法
- 收集304名受试者在聆听约70分钟短篇故事时的fMRI数据,以捕捉自然语言处理过程中的神经反应。
- 使用GPT-2激活与fMRI信号之间的线性映射,比较不同受试者与体素上的模型与大脑表征。
- 将预测得分定义为:当将不同距离d的未来词序列拼接到当前上下文时,大脑预测准确率的提升,采用线性回归模型计算。
- 将预测距离定义为在受试者与体素间使预测得分最大化的距离d,重点关注预测曲线非平坦的脑区。
- 通过识别在GPT-2中使预测性能最大的网络层(k),引入预测深度,揭示分层处理的深度。
- 采用扰动方法将GPT-2激活分解为句法与语义成分:生成10个句法相同但语义随机的未来序列,取平均以分离句法内容。
实验结果
研究问题
- RQ1人类大脑是否能预测超出下一个词的语义内容?若能,预测距离有多远?
- RQ2大脑的长程预测能力与当前最先进深度语言模型(如GPT-2)相比如何?
- RQ3大脑中的长程预测主要由句法结构还是语义结构驱动?不同皮层区域的差异是什么?
- RQ4神经网络表征的深度能否预测大脑基线预测的深度?这种对齐关系在不同层级的分层处理中是否保持?
- RQ5通过引入长程预测表示增强语言模型,能否提升其与人类大脑活动的一致性?
主要发现
- 人类大脑能以显著准确性预测长达8个词前的语言内容,表现为在d=8处预测得分达到峰值,而GPT-2模型无法实现类似长程预测性能。
- 大脑区域如前中颞沟(aSTS/mSTS)与额下回(IFG)显示出显著的长程预测得分,尤其在句法与语义内容方面。
- 大脑中的预测深度对应于GPT-2的较高网络层(约第8层),表明长程预测在更深层、更抽象的表征中处理。
- 大脑中的句法预测强于语义预测,表现为在d=8处句法成分的预测得分高于语义成分。
- 在关键语言区域,d=8与d=0的预测得分差异在所有受试者中具有统计学显著性(p < 0.01),证实预测非平坦且具有实际意义。
- 尽管GPT-2激活与fMRI信号之间存在强烈线性映射,但模型无法预测远距离内容,导致其与大脑长程预测机制之间存在根本性不匹配。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。