[论文解读] Modelling dependency completion in sentence comprehension as a Bayesian hierarchical mixture process: A case study involving Chinese relative clauses
本文提出一种贝叶斯分层有限混合模型,以解释汉语关系子句理解中的依存关系补全现象,将直接访问模型(含失败/重检索成分)与传统的距离依赖解释进行对比。结果表明,直接访问模型更能解释阅读时间数据,且主语关系子句中的失败率更高,提示处理困难源于检索失败而非距离本身。
We present a case-study demonstrating the usefulness of Bayesian hierarchical mixture modelling for investigating cognitive processes. In sentence comprehension, it is widely assumed that the distance between linguistic co-dependents affects the latency of dependency resolution: the longer the distance, the longer the retrieval time (the distance-based account). An alternative theory, direct-access, assumes that retrieval times are a mixture of two distributions: one distribution represents successful retrievals (these are independent of dependency distance) and the other represents an initial failure to retrieve the correct dependent, followed by a reanalysis that leads to successful retrieval. We implement both models as Bayesian hierarchical models and show that the direct-access model explains Chinese relative clause reading time data better than the distance account.
研究动机与目标
- 探究句子理解中的依存关系补全是否更符合距离依赖解释还是直接访问模型。
- 比较贝叶斯分层线性模型与有限混合模型在汉语关系子句阅读时间数据上的预测性能。
- 确定主语关系子句中处理难度增加的原因是否源于更长的依存距离,或更高的检索失败率。
- 展示贝叶斯分层混合模型在心理语言学认知过程建模中的实用性。
提出的方法
- 使用贝叶斯分层线性模型(HLM)对阅读时间进行建模,以检验距离依赖解释,固定效应包括关系子句类型,随机截距为参与者和项目。
- 实施贝叶斯分层有限混合模型,以表示两种认知状态:成功的直接访问(与距离无关)和失败检索后的重新分析(与距离相关)。
- 利用直接访问模型估计主语和宾语关系子句中涉及检索失败的比例(分别记为 p_sr 和 p_or)。
- 应用 K 折交叉验证和留一法信息准则(LOO-IC)比较模型拟合度,以期望对数预测密度(elpd)作为关键指标。
- 通过 JAGS 使用马尔可夫链蒙特卡洛(MCMC)方法估计所有参数的后验分布,包含可信区间和收敛性诊断。
- 使用分层模型复制 Gibson 和 Wu(2013)的数据,以验证跨数据集结果的一致性。
实验结果
研究问题
- RQ1直接访问模型是否比距离依赖解释更好地解释汉语关系子句的阅读时间?
- RQ2主语关系子句中的阅读时间是否因依存距离增加或检索失败比例更高而变慢?
- RQ3贝叶斯分层有限混合模型能否捕捉主语关系子句阅读时间分布的双峰特性?
- RQ4主语与宾语关系子句中检索失败的估计比例是多少,且该差异是否具有统计显著性?
- RQ5分层线性模型与混合模型在模型拟合指标(如 elpd、LOO-IC)上的比较结果如何?
主要发现
- 直接访问模型的预测性能显著优于基于距离的分层线性模型,Δelpd 为 158(标准误 29),表明混合模型有更强的证据支持。
- 检索失败比例差异超过零的后验概率为 96%,提示主语关系子句中检索失败率更高。
- 估计的检索失败比例为:主语关系子句 23%(95% 置信区间:15–33%),宾语关系子句 16%(95% 置信区间:9–25%),表明存在有意义的差异。
- 分层混合模型的 elpd 为 -3801(标准误 38),而分层线性模型为 -3959(标准误 53),确认了更好的拟合度。
- 该模型表明,主语关系子句中处理困难的增加并非源于更长的依存距离本身,而是初始检索失败的可能性更高。
- 结果支持直接访问模型作为依存关系补全更准确的认知解释,且在句法结构更复杂的语境中,失败率更高。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。