Skip to main content
QUICK REVIEW

[论文解读] Early Prediction of Course Grades: Models and Feature Selection

Hengxuan Li, Collin Lynch|arXiv (Cornell University)|Dec 3, 2018
Online Learning and Analytics参考文献 10被引用 13
一句话总结

本研究提出利用机器学习模型,基于混合式课程前六周的学生行为数据,实现课程成绩的早期预测。研究在来自在线作业日志和操作行为的特征上,评估了五种算法——SVM、SVR、决策树、朴素贝叶斯和K-最近邻——发现SVM表现优于其他模型,并显著优于基线预测。

ABSTRACT

In this paper, we compare predictive models for students' final performance in a blended course using a set of generic features collected from the first six weeks of class. These features were extracted from students' online homework submission logs as well as other online actions. We compare the effectiveness of 5 different ML algorithms (SVMs, Support Vector Regression, Decision Tree, Naive Bayes and K-Nearest Neighbor). We found that SVMs outperform other models and improve when compared to the baseline. This study demonstrates feasible implementations for predictive models that rely on common data from blended courses that can be used to monitor students' progress and to tailor instruction.

研究动机与目标

  • 利用早期课程数据开发并评估学生最终课程成绩的预测模型。
  • 识别在有限数据条件下表现最佳的机器学习算法。
  • 评估在混合式学习环境中,从学生在线互动中提取特征的影响。
  • 提供一种可行的、基于数据的早期干预方法,用于课程成绩预测。

提出的方法

  • 从混合式课程前六周的在线作业提交日志及其他数字互动中收集学生行为特征。
  • 提取18个通用特征,包括提交频率、花费时间、正确率和交互模式。
  • 训练五种机器学习模型:SVM、支持向量回归(SVR)、决策树、朴素贝叶斯和K-最近邻。
  • 使用RMSE和决定系数(R-squared)等标准回归指标,在保留的测试集上评估模型性能。
  • 应用特征选择技术,识别对模型训练最具预测力的特征子集。
  • 使用来自大学混合式课程的真实数据集,以确保实际相关性和可推广性。

实验结果

研究问题

  • RQ1哪种机器学习模型能实现对最终课程成绩最准确的早期预测?
  • RQ2不同组合的早期课程行为特征如何影响预测性能?
  • RQ3特征选择在多大程度上提升了早期成绩预测的模型准确性?
  • RQ4能否使用在线学习平台中通用且易于收集的特征训练出的模型,超越简单的基线模型?
  • RQ5此类模型在真实混合式学习环境中的实际可行性如何?

主要发现

  • SVM(支持向量机)在所有测试模型中表现出最高的预测准确性,优于SVR、决策树、朴素贝叶斯和K-最近邻。
  • 与基线模型相比,SVM模型显著提升了预测性能,证明了机器学习在早期干预中的价值。
  • 特征选择通过聚焦于早期课程活动中最具信息量的行为模式,提升了模型性能。
  • 本研究证实,早期行为数据——尤其是来自在线作业系统的行为数据——可可靠预测最终课程结果。
  • 结果支持在实时教育监控系统中部署轻量级、可扩展的模型。
  • 该方法可利用常见数据源,在标准混合式学习平台中实现部署。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。