[论文解读] Happy Are Those Who Grade without Seeing: A Multi-Task Learning Approach to Grade Essays Using Gaze Behaviour
本文提出了一种多任务学习框架,利用少量作文中的注视行为数据来提升自动作文评分(AEG)性能,即使在大多数作文中缺乏注视数据的情况下也能实现性能提升。通过联合学习注视模式与作文评分,该模型在已见和未见的作文集合上均实现了统计上显著的性能提升——在加权 kappa(QWK)指标上最高提升了 0.0137,证明了注视行为模式在不同领域间的可迁移性。
The gaze behaviour of a reader is helpful in solving several NLP tasks such as automatic essay grading. However, collecting gaze behaviour from readers is costly in terms of time and money. In this paper, we propose a way to improve automatic essay grading using gaze behaviour, which is learnt at run time using a multi-task learning framework. To demonstrate the efficacy of this multi-task learning based approach to automatic essay grading, we collect gaze behaviour for 48 essays across 4 essay sets, and learn gaze behaviour for the rest of the essays, numbering over 7000 essays. Using the learnt gaze behaviour, we can achieve a statistically significant improvement in performance over the state-of-the-art system for the essay sets where we have gaze data. We also achieve a statistically significant improvement for 4 other essay sets, numbering about 6000 essays, where we have no gaze behaviour data available. Our approach establishes that learning gaze behaviour improves automatic essay grading.
研究动机与目标
- 为解决自动作文评分中收集注视行为数据成本过高的问题,通过从少量种子作文中学习注视模式。
- 在多任务学习框架中,将注视行为作为辅助任务,以提升 AEG 性能。
- 评估从少量作文中学习的注视行为模式是否能泛化到无任何注视数据的未见作文集合。
- 发布一个全新的注视行为数据集和代码,以支持未来在注视增强型 NLP 任务中的研究。
提出的方法
- 使用眼动仪设备,从 4 个作文集合中的 48 篇作文中收集注视行为数据,重点关注兴趣区域、注视点和扫视(前向与回溯)。
- 定义注视行为特征,包括停留时间、首次注视持续时间、回溯指示符、跳过次数和运行次数,作为输入表示。
- 训练一个多任务学习模型,通过共享表示,联合优化作文评分(主任务)和注视行为预测(辅助任务)。
- 将学习到的注视行为模式迁移至另外 4 个作文集合中超过 7,000 篇无注视数据的作文中,使用相同的模型架构。
- 通过消融研究评估各个注视特征对整体性能的贡献。
- 以加权 kappa(QWK)为评估指标,与基线系统(包括基于字符串核的模型)进行比较。
实验结果
研究问题
- RQ1从少量作文中学习的注视行为模式是否能提升在更大规模未见作文集合上的自动作文评分性能?
- RQ2哪些注视行为特征对提升作文评分性能贡献最大?
- RQ3使用以英语为母语者的注视行为数据是否比使用非母语者的数据表现更优?
- RQ4多任务学习框架能否有效实现不同作文题目和领域间注视行为知识的迁移?
主要发现
- 当同时使用 48 篇作文的注视数据和迁移后的注视行为时,所提出的多任务学习模型在未见作文集合上实现了 0.771 的平均 QWK,显著优于基线系统(p < 0.05)。
- 在消融实验中,停留时间(Dwell Time)和首次注视持续时间(First Fixation Duration)特征对性能贡献最大,分别带来了 0.0137 和 0.0136 的 QWK 提升。
- 仅使用以英语为母语者的注视行为数据时,在已见集合上实现了 0.779 的平均 QWK,在未见集合上为 0.748,与无注视数据相比具有统计显著性提升(p = 0.0084)。
- 该系统在未见作文集合上实现了统计显著的性能提升(p < 0.05),证明了注视行为模式在不同领域间具有泛化能力。
- 所有注视特征的归一化均方误差(MSE)稳定保持在 0.125 至 0.128 之间,表明特征学习具有稳定性和可靠性。
- 该模型优于基于字符串核的基线系统(在已见集合上 QWK = 0.750),并在未见集合上实现了 0.685 的 QWK,凸显了注视增强学习的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。