[论文解读] The Natural Stories Corpus
自然故事语料库是一个心理语言学数据集,包含10篇经过编辑的叙事文本,旨在高频包含罕见、标记性强的句法结构(如非局部动词短语并列、非限定性关系从句和it-强调句),同时保持语言的流畅性和连贯性。该语料库提供了人工校对的Penn Treebank风格句法解析、Universal Dependencies解析、来自181名母语者的自定进度阅读时间,以及音频记录,使语言处理模型能够在典型自然语料库之外的复杂句法现象上进行稳健评估。
It is now a common practice to compare models of human language processing by predicting participant reactions (such as reading times) to corpora consisting of rich naturalistic linguistic materials. However, many of the corpora used in these studies are based on naturalistic text and thus do not contain many of the low-frequency syntactic constructions that are often required to distinguish processing theories. Here we describe a new corpus consisting of English texts edited to contain many low-frequency syntactic constructions while still sounding fluent to native speakers. The corpus is annotated with hand-corrected parse trees and includes self-paced reading time data. Here we give an overview of the content of the corpus and release the data.
研究动机与目标
- 为解决现有自然语料的局限性,即极少包含低频、处理困难的句法结构,而这些结构对区分心理语言学模型至关重要。
- 创建一个语料库,结合自然语料的广泛覆盖范围与实验刺激的针对性和控制性结构,以支持大规模模型评估。
- 提供一个标准化、公开可用的测试集,包含丰富的注释——句法解析、阅读时间与音频——以评估人类句子处理模型。
- 通过包含引发记忆整合成本和解析复杂性的句法结构,支持预测人类处理难度的模型开发。
- 通过发布一个保持叙事连贯性的同时最大化句法多样性的基础语料库,促进未来注释和数据收集。
提出的方法
- 通过编辑自然叙事文本,系统性地融入低频句法结构,同时保持语言流畅性和叙事连贯性,构建该语料库。
- 所有文本均经人工校对,生成准确的Penn Treebank风格短语结构解析,确保高质量的句法注释。
- 从人工校对的短语结构树自动生成Universal Dependencies解析,以支持跨范式兼容性。
- 通过Amazon Mechanical Turk,从181名英语母语者收集自定进度阅读(SPR)时间,使用虚线移动窗口显示以控制阅读速度。
- 制作了音频记录,并与文本进行词对齐,以支持语音学和语调分析。
- 应用数据排除标准:在故事问题理解测试中正确率低于50%,或反应时间低于100毫秒或高于3000毫秒的参与者被剔除。
实验结果
研究问题
- RQ1心理语言学模型在包含自然语料中罕见句法结构的句子上的阅读时间预测能力如何?
- RQ2在富含标记性句法结构的语料中,标准处理预测因子(频率、词长、意外度)与阅读时间的相关性如何?
- RQ3在复杂句法结构中,阅读时间的个体间相关性是否在不同参与者中保持稳健?
- RQ4自然故事语料库中标记性句法结构的出现率与现有的邓迪语料库和UCL语料库相比如何?
- RQ5该语料库是否能在大规模自然叙事语境中可靠检测到已知的心理语言学效应(如频率效应和意外度效应)?
主要发现
- 自然故事语料库中,非局部动词短语并列、非限定性关系从句和it-强调句等标记性句法结构的出现频率显著高于基于自然语料的邓迪语料库。
- 阅读时间的个体间相关性在参与者间保持稳健,每篇故事的平均留一法互相关(ISC)值表明处理模式具有一致性。
- 线性混合效应模型证实,更高的词频和三元语法概率显著降低了阅读时间(β = -2.61 和 β = -2.19),而更长的词长则增加了阅读时间(β = 4.21),复现了已知的心理语言学效应。
- 尽管包含罕见句法结构,该语料库仍成功保持了叙事的流畅性和连贯性,经参与者理解度和数据质量检查验证。
- 通过包含自定进度阅读时间、人工校对的句法解析和音频记录,该语料库支持在句法、认知和语音学维度上对语言处理模型进行多模态评估。
- 该数据集以CC BY-NC-SA许可发布,支持广泛重用和衍生工作,且须遵循相同条款,有助于长期研究和模型开发。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。