Skip to main content
QUICK REVIEW

[论文解读] Neural network approach to classifying alarming student responses to online assessment

Christopher M. Ormerod, Amy E. Harris|arXiv (Cornell University)|Sep 20, 2018
Online Learning and Analytics参考文献 37被引用 4
一句话总结

本文提出一种基于双向堆叠LSTM与GRU网络及注意力机制的深度学习方法,通过将典型回答与危险回答分类,以检测在线测评中的预警性学生回答(如自残、暴力或虐待行为)。表现最佳的模型——带有注意力机制的双向堆叠LSTM,在10%的审查阈值下实现了98.7%的预警检测率,显著提升了高风险案例的早期干预能力。

ABSTRACT

Automated scoring engines are increasingly being used to score the free-form text responses that students give to questions. Such engines are not designed to appropriately deal with responses that a human reader would find alarming such as those that indicate an intention to self-harm or harm others, responses that allude to drug abuse or sexual abuse or any response that would elicit concern for the student writing the response. Our neural network models have been designed to help identify these anomalous responses from a large collection of typical responses that students give. The responses identified by the neural network can be assessed for urgency, severity, and validity more quickly by a team of reviewers than otherwise possible. Given the anomalous nature of these types of responses, our goal is to maximize the chance of flagging these responses for review given the constraint that only a fixed percentage of responses can viably be assessed by a team of reviewers.

研究动机与目标

  • 开发一种自动化系统,识别自由文本在线测评中的预警性学生回答,如自残或暴力威胁。
  • 解决传统自动评分系统难以捕捉的、细微且依赖上下文的异常语言检测挑战。
  • 在仅允许人工审查固定比例回答的约束下,最大化预警检测率。
  • 在高风险教育评估环境中,优化敏感性与误报率之间的平衡。

提出的方法

  • 本研究采用循环神经网络(RNN),特别是GRU和LSTM,以建模学生回答中的序列文本模式。
  • 模型使用词嵌入进行训练,并在1,000个预警样本的保留测试集上通过五折交叉验证进行评估。
  • 架构包含堆叠式、双向式以及注意力增强的变体,以提升上下文建模与长距离依赖捕捉能力。
  • 超参数调优聚焦于循环单元大小、堆叠深度、双向性以及注意力机制,以最大化检测敏感性。
  • 性能通过在不同审查阈值(1%至10%)下正确标记的预警比例进行衡量。
  • 采用集成与聚合模型输出,以进一步提升检测性能,超越单一模型表现。

实验结果

研究问题

  • RQ1在GRU、LSTM及其堆叠式、双向式或注意力增强变体中,哪种RNN架构在学生回答中的预警检测性能最高?
  • RQ2堆叠、双向性与注意力机制等架构组件对检测敏感性与误报率的独立影响如何?
  • RQ3深度学习模型能否以高精度有效区分上下文微妙的预警(如夸张表达)与非预警回答?
  • RQ4通过多个架构的集成平均,模型性能可提升至何种程度?

主要发现

  • 在10%的审查阈值下,带有注意力机制的双向堆叠LSTM模型实现了最高的预警检测率(98.7%)。
  • 堆叠两层循环单元(128,128)带来了最大的性能提升,相比单层模型检测率提高了14.98%。
  • 注意力机制的使用平均提升了4.15%的检测率,而双向建模额外贡献了2.20%的提升。
  • 无注意力机制的堆叠LSTM模型在10%审查阈值下实现了96.7%的检测率,展现出强劲的基线性能。
  • LSTM-based模型相比GRU-based模型平均提升了8.05%的检测准确率。
  • 聚合模型输出进一步提升了检测性能,超越了表现最佳的单个模型,表明未来基于集成的优化具有潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。