[论文解读] Context Limitations Make Neural Language Models More Human-Like
本文表明,对现代神经网络语言模型(LMs)的上下文长度施加约束,可显著提升其模拟人类阅读行为的能力,表现为心理测量预测力(PPP)的提升。通过将n-gram风格的上下文截断应用于基于Transformer的LMs,作者发现更短的上下文访问——模拟人类工作记忆限制——能更好地与人类阅读时间对齐,尤其在句法复杂的结构中表现更优。
Language models (LMs) have been used in cognitive modeling as well as engineering studies -- they compute information-theoretic complexity metrics that simulate humans' cognitive load during reading. This study highlights a limitation of modern neural LMs as the model of choice for this purpose: there is a discrepancy between their context access capacities and that of humans. Our results showed that constraining the LMs' context access improved their simulation of human reading behavior. We also showed that LM-human gaps in context access were associated with specific syntactic constructions; incorporating syntactic biases into LMs' context access might enhance their cognitive plausibility.
研究动机与目标
- 探究限制现代神经语言模型中的上下文访问是否能提升其对阅读过程中人类认知负荷的模拟能力。
- 解决现代LMs广泛上下文访问与人类有限且选择性上下文访问之间的不匹配问题。
- 探究句法结构是否影响上下文限制在提升认知合理性方面的有效性。
- 挑战‘更高的下一个词预测准确率(更低的困惑度)始终意味着更好的认知建模表现’这一假设。
- 提出在上下文访问机制中引入句法偏置,可增强神经LM的认知合理性。
提出的方法
- 对预训练的基于Transformer的神经语言模型应用n-gram化技术,截断上下文长度,以模拟有限的工作记忆。
- 仅使用最近的n个标记(如n=2、4、8、16)计算意外度分数,以模拟在上下文受限条件下的增量处理。
- 使用心理测量预测力(PPP)评估模型性能,将预测的阅读时间与280种实验配置下的人类眼动追踪数据进行比较。
- 对句法结构进行探索性分析,识别哪些结构在短或长上下文访问下受益最多。
- 将PPP与困惑度(PPL)进行相关性分析,评估更好的下一个词预测准确率是否与更好的认知建模表现一致。
- 使用多语言数据(英语和日语)测试模型在类型学上差异较大的语言中的泛化能力。
实验结果
研究问题
- RQ1是否限制神经语言模型中的上下文访问能提升其预测人类阅读行为的能力?
- RQ2不同上下文长度(如n=2、4、8、16)如何影响语言模型的心理测量预测力(PPP)?
- RQ3是否存在某些句法结构,其PPP在短或长上下文访问下表现更优?
- RQ4语言模型中,下一个词预测准确率(困惑度)与认知合理性(PPP)之间是否存在权衡?
- RQ5在上下文访问机制中引入句法偏置是否能进一步提升神经语言模型的认知合理性?
主要发现
- 具有更短上下文访问(如n=2–4)的语言模型在预测人类阅读时间方面持续优于全上下文模型,表现为更高的心理测量预测力(PPP)。
- 在多种语言模型和类型学上多样的语言(包括英语和日语)中,受限上下文带来的PPP提升均具有鲁棒性。
- 困惑度(PPL)与PPP之间没有强烈的负相关性;事实上,皮尔逊相关系数为轻微正相关(r=0.15),表明更好的下一个词预测并不保证更好的认知建模表现。
- 特定句法结构——尤其是涉及长距离依存关系的结构——对上下文长度更为敏感,表明上下文限制并非在所有情况下都同等有益。
- 研究发现,上下文限制效应在句法结构中系统性分布,暗示未来模型可通过引入句法偏置来优化上下文访问机制。
- 结果支持基于记忆的人类句子处理理论,即有限工作记忆限制处理过程,且提示损失性上下文意外度比全上下文意外度更具认知合理性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。