[论文解读] WebQAmGaze: A Multilingual Webcam Eye-Tracking-While-Reading Dataset
WebQAmGaze 首次引入了一个多语言、基于网络摄像头的阅读眼动追踪数据集,包含词级注视特征,通过 Amazon Mechanical Turk 使用 WebGazer 收集。该数据集与高质量眼动追踪数据表现出中等程度的相关性,并表明对相关文本片段的注视能够预测正确的理解答案,从而为可解释人工智能和自然语言处理模型可解释性提供低成本、可扩展的数据收集方法。
We present WebQAmGaze, a multilingual low-cost eye-tracking-while-reading dataset, designed as the first webcam-based eye-tracking corpus of reading to support the development of explainable computational language processing models. WebQAmGaze includes webcam eye-tracking data from 600 participants of a wide age range naturally reading English, German, Spanish, and Turkish texts. Each participant performs two reading tasks composed of five texts each, a normal reading and an information-seeking task, followed by a comprehension question. We compare the collected webcam data to high-quality eye-tracking recordings. The results show a moderate to strong correlation between the eye movement measures obtained with the webcam compared to those obtained with a commercial eye-tracking device. When validating the data, we find that higher fixation duration on relevant text spans accurately indicates correctness when answering the corresponding questions. This dataset advances webcam-based reading studies and opens avenues to low-cost and diverse data collection. WebQAmGaze is beneficial to learn about the cognitive processes behind question-answering and to apply these insights to computational models of language understanding.
研究动机与目标
- 开发一种利用网络摄像头而非实验室设备进行阅读过程中眼动追踪数据收集的低成本、可扩展方法。
- 创建涵盖英语、西班牙语和德语的多语言数据集,以支持多样化的自然语言处理应用,并减少眼动追踪研究中的语言偏差。
- 探究基于网络摄像头的眼动追踪数据是否能根据注视模式预测阅读理解问答任务中的正确答案。
- 对比基于网络摄像头的眼动追踪特征与商用眼动仪数据的质量,评估其在自然语言处理应用中的可靠性。
- 通过提供正常阅读和信息检索阅读任务中的词级注视特征,支持对阅读过程中认知过程的研究。
提出的方法
- 通过 Amazon Mechanical Turk 使用 WebGazer 开源库,利用网络摄像头收集眼动追踪数据,实现远程、大规模的数据收集。
- 基于现有的多语言问答数据集(XQuAD 和 MECO)设计了两种阅读任务——正常阅读和信息检索阅读。
- 通过采样率、注视点数量和校准一致性等标准,对注视数据进行预处理,过滤低质量记录。
- 提取词级注视特征,如目标词段的注视次数和持续时间,以分析阅读过程中的认知处理。
- 对基于网络摄像头的眼动特征与高质量眼动追踪数据进行对比分析,评估其可靠性。
- 使用统计建模方法检验相关文本片段的注视模式是否能预测正确的理解回答。
实验结果
研究问题
- RQ1基于网络摄像头的眼动追踪数据在多大程度上能预测问答任务中的正确答案?
- RQ2在多语言文本中,正常阅读与信息检索任务的注视模式有何差异?
- RQ3基于网络摄像头的眼动追踪提取的词级注视特征与商用眼动仪数据的相关性如何?
- RQ4能否利用网络摄像头录制的注视特征提升自然语言处理模型在问答任务中的可解释性?
- RQ5在通过众包网络实验收集可靠眼动追踪数据时,面临哪些方法论和数据质量方面的挑战?
主要发现
- 文本中与答案相关片段的注视与正确理解回答显著相关,表明注视模式可作为认知处理的代理指标。
- 在基于网络摄像头的眼动追踪(WebGazer)与商用眼动仪提取的注视特征之间发现了中等程度的相关性,表明其数据质量在研究目的下具有合理性。
- 该数据集显示,信息检索任务导致阅读速度加快且注视次数减少,与以往关于任务驱动阅读行为的研究结果一致。
- 基于采样率和注视点数量的过滤程序能有效剔除低质量数据,提升信号可靠性。
- 该数据集通过使用维基百科中的自然文本和多语言问答基准数据,展现出生态效度。
- 结果支持使用低成本网络摄像头眼动追踪技术在认知建模和自然语言处理可解释性应用中的可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。