[论文解读] The Copenhagen Corpus of Eye Tracking Recordings from Natural Reading of Danish Texts
本文介绍了 CopCo,这是首个丹麦语自然阅读的眼动追踪语料库,包含来自演讲手稿的1,832个句子,数据来自22名参与者。该语料库提供了诸如注视持续时间、跳过率和着陆位置等眼动特征,表明词长和词频显著影响语言处理,与跨语言模式一致,使其成为丹麦语认知导向自然语言处理和心理语言学研究的宝贵资源。
Eye movement recordings from reading are one of the richest signals of human language processing. Corpora of eye movements during reading of contextualized running text is a way of making such records available for natural language processing purposes. Such corpora already exist in some languages. We present CopCo, the Copenhagen Corpus of eye tracking recordings from natural reading of Danish texts. It is the first eye tracking corpus of its kind for the Danish language. CopCo includes 1,832 sentences with 34,897 tokens of Danish text extracted from a collection of speech manuscripts. This first release of the corpus contains eye tracking data from 22 participants. It will be extended continuously with more participants and texts from other genres. We assess the data quality of the recorded eye movements and find that the extracted features are in line with related research. The dataset available here: https://osf.io/ud8s5/.
研究动机与目标
- 建立一个大规模、生态有效的丹麦语自然阅读眼动追踪语料库,以弥补该语言现有眼动资源有限的不足。
- 通过在语境丰富、自然发生的文本中研究实时语言处理,支持心理语言学研究。
- 通过提供反映认知处理努力的眼动特征,推动认知启发式自然语言处理的发展。
- 通过提供一种在研究较少的语言(如丹麦语)中的基准数据集,支持跨语言比较。
- 通过眼动增强特征(如注视持续时间与跳过率)支持NLP模型的开发与解释。
提出的方法
- 语料库从转录的演讲手稿中构建,提取了1,832个句子,共包含34,897个丹麦语词素。
- 使用标准化记录设备,从22名母语丹麦语读者中收集了他们在自然阅读这些文本时的眼动数据。
- 提取并验证了关键眼动特征(首次注视持续时间、平均注视持续时间、总注视持续时间、首次通过时间与越过时间)以确保数据质量。
- 使用Spearman等级相关分析,研究了词级特征(如跳过率、着陆位置与注视持续时间)与词长和词频之间的关系。
- 将该数据集与现有语料库(如GECO、ZuCo)进行比较,确认其特征范围与其它语言的研究发现一致。
- 该语料库设计为可持续扩展,未来将纳入更多参与者和文本类型,包括社交媒体和维基百科内容。
实验结果
研究问题
- RQ1在丹麦语自然阅读中,词长与词频如何影响注视与跳过行为?
- RQ2丹麦语的眼动模式在多大程度上与跨语言研究中关于注视持续时间与着陆位置的发现一致?
- RQ3自然阅读中的眼动特征能否可靠地用于建模丹麦语中的认知处理努力?
- RQ4个体差异(如年龄、阅读熟练度)在多大程度上影响丹麦语阅读中的眼动模式?
- RQ5该语料库在多大程度上可支持认知启发式NLP模型在丹麦语中的训练与解释?
主要发现
- 每个词平均被注视0.69次(标准差 = 1.05),注视持续时间与跳过率均处于类似语料库(如GECO与ZuCo)中观察到的范围内。
- 词长越长,越可能被注视,词长与着陆位置指数之间存在显著正相关(Spearman等级相关系数 rho = 0.90,p < 0.0001)。
- 高频词更常被跳过:参与者的整体跳过率在0.29至0.58之间,表明高频词处理更高效。
- 随着词频增加,对某词的注视比例下降,证实词频调节了丹麦语阅读中的处理努力。
- 着陆位置与字符频率呈中等程度相关(rho = 0.35,p = 0.069),但其主要受词长预测,表明视觉因素在初始着陆中占主导地位。
- 在着陆字符上的注视持续时间在元音与辅音之间无显著差异,表明初始注视无明显的语音或正字法偏向。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。