Skip to main content
QUICK REVIEW

[논문 리뷰] Predicting student performance using data from an auto-grading system

Huanyi Chen, Paul A. S. Ward|arXiv (Cornell University)|2021. 02. 02.
Online Learning and Analytics인용 수 7
한 줄 요약

이 연구는 프로그래밍 과정에서 Marmoset 자동 채점 데이터를 사용하여 의사결정나무와 선형 회귀를 통해 학생 성취도를 예측한다. 학생의 첫 번째 타당한 제출 이후 마감일까지의 시간 간격인 제출 시간 간격(STI)이 빈도 높은 성취도를 보이는 학생을 식별하는 데 가장 강력한 예측 변수로 나타나며, 정밀도와 F-측도에서 다른 특징들보다 뛰어나다.

ABSTRACT

As online auto-grading systems appear, information obtained from those systems can potentially enable researchers to create predictive models to predict student behaviour and performances. In the University of Waterloo, the ECE 150 (Fundamentals of Programming) Instructional Team wants to get an insight into how to allocate the limited teaching resources better to achieve improved educational outcomes. Currently, the Instructional Team allocates tutoring time in a reactive basis. They help students "as-requested". This approach serves those students with the wherewithal to request help; however, many of the students who are struggling do not reach out for assistance. Therefore, we, as the Research Team, want to explore if we can determine students which need help by looking into the data from our auto-grading system, Marmoset. In this paper, we conducted experiments building decision-tree and linear-regression models with various features extracted from the Marmoset auto-grading system, including passing rate, testcase outcomes, number of submissions and submission time intervals (the time interval between the student's first reasonable submission and the deadline). For each feature, we interpreted the result at the confusion matrix level. Specifically for poor-performance students, we show that the linear-regression model using submission time intervals performs the best among all models in terms of Precision and F-Measure. We also show that for students who are misclassified into poor-performance students, they have the lowest actual grades in the linear-regression model among all models. In addition, we show that for the midterm, the submission time interval of the last assignment before the midterm predicts the midterm performance the most. However, for the final exam, the midterm performance contributes the most on the final exam performance.

연구 동기 및 목표

  • 자동 채점 시스템 데이터가 프로그래밍 과정에서의 학생 성취도를 예측할 수 있는지 조사하기.
  • 중간고사 및 기말고사 결과와 관련된 학생 제출 행동 패턴을 규명하기.
  • 실패하기 전에 위험에 처한 학생을 예측함으로써 사전적 수업 자원 배분을 지원하기.

제안 방법

  • 합격률, 테스트 케이스 결과, 제출 횟수, 제출 시간 간격(STI)를 포함한 Marmoset 자동 채점 데이터를 수집하였다.
  • 시험 성적을 바탕으로 학생을 양호, 만족스럽고, 열악한 성취도로 분류하기 위해 C4.5 의사결정나무 알고리즘을 적용하였다.
  • STI를 핵심 특징으로 사용하여 중간고사 및 기말고사의 수치적 성적을 예측하기 위해 선형 회귀를 사용하였다.
  • 정밀도, 재현율, F-측도, 평균 절대 오차를 평가 지표로 사용하였으며, 특히 잘못 분류된 열악한 성취도 학생에 초점을 맞추었다.
  • 과제와 시험 간 특징 중요도를 비교하여 핵심 예측 시간 창을 규명하였다.
  • 예측된 수치적 성적을 성취도 범주로 변환하여 열악한 성취도 학생에 대한 분류 성능을 평가하였다.

실험 결과

연구 질문

  • RQ1Marmoset 자동 채점 데이터로 제출 행동을 기반으로 학생 성취도 범주(양호, 만족스럽고, 열악함)를 예측할 수 있는가?
  • RQ2자동 채점 시스템 로그에서 유도된 특징을 사용하여 중간고사 및 기말고사의 수치적 성적을 예측할 수 있는가?
  • RQ3Marmoset 특징들(예: 제출 시간 간격, 테스트 케이스 결과 등) 중에서 학생 성취도를 가장 잘 예측하는 것은 무엇인가?
  • RQ4마감일에 비해 제출 시점의 시기와 시험 성취도 간의 상관관계는 어떠한가?
  • RQ5위험에 처한 학생을 식별하기 위해 제출 시간 간격(STI)의 예측 능력은 어느 정도인가?

주요 결과

  • STI를 사용한 선형 회귀 모델이 중간고사 및 기말고사 모두에서 열악한 성취도 학생을 예측할 때 가장 높은 정밀도와 F-측도를 기록하였다.
  • STI 기반 선형 회귀 모델에 의해 잘못 분류된 열악한 성취도 학생들은 실제 성적이 가장 낮았으며, 이는 모델의 보정이 더 우수함을 시사한다.
  • 중간고사 성취도 예측에서는 시험 직전 과제가 중간고사 성취도와 가장 높은 상관관계(r = 0.72)를 보였다.
  • 기말고사 성취도 예측에서는 중간고사 성취도가 기말고사 점수와 가장 강한 상관관계(r = 0.72)를 보였다.
  • 선형 회귀 모델은 중간고사 성취도를 평균 오차 -5.76점(SD = 16.44)으로 예측하였고, 기말고사 성취도는 평균 오차 +0.92점(SD = 17.12)으로 예측하였다.
  • 합격률과 테스트 케이스 결과를 기반으로 한 의사결정나무 모델은 강한 편향을 보였으며, 중간고사 예측에서 열악한 성취도 학생을 정확히 식별하지 못했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.