Skip to main content
QUICK REVIEW

[论文解读] Neural Multi-task Learning in Automated Assessment

Ronan Cummins, Marek Rei|arXiv (Cornell University)|Jan 21, 2018
Topic Modeling参考文献 11被引用 14
一句话总结

本文提出了一种神经多任务学习模型,联合训练英语学习者写作中的语法错误检测(GED)与自动作文评分(AES)。通过双向LSTM共享表示,并同时优化两项任务,该模型显著提升了AES性能——达到0.459的QWK,而GED性能基本保持不变,表明作文质量与错误检测密切相关。

ABSTRACT

Grammatical error detection and automated essay scoring are two tasks in the area of automated assessment. Traditionally these tasks have been treated independently with different machine learning models and features used for each task. In this paper, we develop a multi-task neural network model that jointly optimises for both tasks, and in particular we show that neural automated essay scoring can be significantly improved. We show that while the essay score provides little evidence to inform grammatical error detection, the essay score is highly influenced by error detection.

研究动机与目标

  • 探究联合训练语法错误检测(GED)与自动作文评分(AES)是否能提升自动写作评估的性能。
  • 确定GED与AES之间的相互依赖程度,特别是作文质量信号是否能改善错误检测,反之亦然。
  • 开发并评估一种集成GED、AES与语言建模目标的神经多任务模型,构建统一的端到端框架。
  • 评估将GED作为训练信号是否能提升ESL写作中AES的性能,特别是在公开的FCE数据集上。

提出的方法

  • 使用双向LSTM将整篇作文作为序列输入,将双向隐藏状态在时间步上拼接并取平均,形成上下文向量。
  • 上下文向量输入两个独立的输出头:一个用于二值序列标注(GED),另一个通过Sigmoid缩放输出层预测整体作文得分(AES)。
  • 模型使用联合损失函数进行训练:E = (1 - γ_aes)(E_ged + 0.1×E_lm) + γ_aes×E_aes,其中γ_aes控制GED与AES目标之间的平衡。
  • 语言建模被用作半监督辅助目标,以提升序列表示学习效果。
  • 超参数γ_aes在开发集上从0.0到1.0以0.1为步长进行调优,以寻找任务间的最优权衡。
  • 模型性能通过F₀.₅(GED)与二次加权 kappa(QWK,AES)进行评估,并与强基线神经AES模型(NEA)进行比较。

实验结果

研究问题

  • RQ1联合训练语法错误检测与自动作文评分是否能提升任一任务的性能?
  • RQ2作文得分在多大程度上能为语法错误检测提供有用监督?
  • RQ3将错误检测作为信号整合后,对自动作文评分性能有何影响?
  • RQ4在FCE数据集上,该多任务神经模型是否能超越单任务基线模型在ESL写作AES任务中的表现?

主要发现

  • 加入GED目标后,AES性能显著提升,QWK从仅使用语言建模时的0.347提升至0.459,差异具有统计学显著性。
  • AES性能最优的γ_aes超参数为0.1,表明当AES损失优先于GED损失时,模型收益最大。
  • 对于GED,其性能在不同γ_aes值下基本保持不变,仅在加入AES目标时F₀.₅提升0.036,表明作文级评分对错误检测的增益有限。
  • 所提出的多任务模型在FCE测试集上达到0.459的QWK,显著优于NEA基线模型(使用300D词嵌入时为0.373)。
  • 该模型成功将GED、语言建模与AES等多种训练信号整合进单一端到端框架,证明了多任务学习在自动写作评估中的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。