[논문 리뷰] A framework for predicting, interpreting, and improving Learning Outcomes
이 논문은 학생의 시험 점수를 인지적, 행동적, 시험 응시 특성에 기반해 예측하는 확장 가능한 프레임워크인 Embibe Score Quotient (ESQ) 모델을 제안한다. 이 모델은 개인화된 샤플리 기반 특성 기여도와 예측 구간을 통해 해석 가능하고 실행 가능한 피드백을 제공한다. 이 모델은 1억 건 이상의 학습자 상호작용을 바탕으로 예측 점수와 실제 점수 간의 중앙값 절대 오차가 4.58%이며 상관계수는 0.93를 기록한다.
It has long been recognized that academic success is a result of both cognitive and non-cognitive dimensions acting together. Consequently, any intelligent learning platform designed to improve learning outcomes (LOs) must provide actionable inputs to the learner in these dimensions. However, operationalizing such inputs in a production setting that is scalable is not trivial. We develop an Embibe Score Quotient model (ESQ) to predict test scores based on observed academic, behavioral and test-taking features of a student. ESQ can be used to predict the future scoring potential of a student as well as offer personalized learning nudges, both critical to improving LOs. Multiple machine learning models are evaluated for the prediction task. In order to provide meaningful feedback to the learner, individualized Shapley feature attributions for each feature are computed. Prediction intervals are obtained by applying non-parametric quantile regression, in an attempt to quantify the uncertainty in the predictions. We apply the above modelling strategy on a dataset consisting of more than a hundred million learner interactions on the Embibe learning platform. We observe that the Median Absolute Error between the observed and predicted scores is 4.58% across several user segments, and the correlation between predicted and observed responses is 0.93. Game-like what-if scenarios are played out to see the changes in LOs, on counterfactual examples. We briefly discuss how a rational agent can then apply an optimal policy to affect the learning outcomes by treating the above model like an Oracle.
연구 동기 및 목표
- 온라인 교육 플랫폼에서 학습 결과(LOs)를 예측하고 향상시키기 위한 확장 가능하고 프로덕션 환경에 적합한 프레임워크 개발.
- 인지적, 행동적, 시험 응시 특성을 통합한 단일 예측 모델을 구축하여 실행 가능한 피드백을 지원.
- 비모수적 분위수 회귀를 활용해 예측의 불확실성을 정량화하고, 샤플리 값 기반으로 설명 가능한 특성 기여도를 제공.
- 대체 시나리오 시뮬레이션을 통해 행동 변화를 유도하고 원하는 LO 향상을 위한 최적화를 통해 개인 맞춤형 학습 피드백을 제공.
- 역사적 데이터 분석과 향후 A/B 테스트를 통해 피드백의 영향을 학습자 행동에 미치는 영향을 검증.
제안 방법
- 1,242개의 개념에 걸쳐 학생의 숙달도를 모델링하기 위해 베이지안 지식 추적(BKT)과 DeepFM을 조합한 모델 네트워크 아키텍처를 활용.
- 통합된 학업적, 행동적, 시험 응시 특성을 기반으로 미래 시험 점수를 예측하기 위해 Embibe Score Quotient (ESQ) 모델을 사용.
- 예측의 불확실성을 정량화하기 위해 비모수적 분위수 회귀를 적용하여 예측 구간을 생성.
- 개별 학습자에 맞는 샤플리 값을 계산하기 위해 TreeExplainer(또한 RNN의 경우 DeepExplainer)를 활용해 특정 특성의 점수 기여도를 기여도 기반으로 분석.
- 피드백을 최적화 문제로 설정하여 특성의 변동을 시뮬레이션하고, 학습자 행동에서 가장 효과적인 변화를 도출.
- 플랫폼 내 타겟팅 메시징이나 게임화된 '만약에' 시나리오를 통해 피드백을 통합하여 학습자가 더 나은 결과를 얻을 수 있도록 유도.
실험 결과
연구 질문
- RQ1세밀한 학습자 상호작용 데이터를 기반으로 통합된 모델이 미래 시험 점수를 얼마나 정확하게 예측할 수 있는가?
- RQ2샤플리 값이 학생의 예측 점수에 대해 실행 가능한 개인 맞춤형 설명을 제공할 수 있는 정도는 어느 정도인가?
- RQ3예측 구간이 실제 교육 환경에서 학습 결과 예측의 불확실성을 효과적으로 정량화할 수 있는가?
- RQ4시뮬레이션된 행동적 피드백이 예측된 학습 결과에 어떤 영향을 미치며, 이를 최적의 학습 전략 유도에 활용할 수 있는가?
- RQ5모델의 해석 가능성에 기반한 개인 맞춤형 피드백이 장기적으로 학습자 행동에 측정 가능한 향상 영향을 미치는가?
주요 결과
- ESQ 모델은 다양한 사용자 세그먼트에서 예측 점수와 관측된 점수 간 중앙값 절대 오차가 4.58%를 기록한다.
- 예측 점수와 실제 점수 간 상관계수는 0.93로 높은 예측 성능을 나타낸다.
- AQ 특성(시도 품질과 관련된 것으로 보임)이 예측 점수의 약 60.98% 기여도를 차지하여 주요 역할을 한다.
- 샤플리 값 분석을 통해 aq_16와 같은 특정 특성은 긍정적 기여(+1.57점)를, bq_20(시험 세션 수)와 같은 다른 특성은 예측 점수 감소(-0.73점)를 유도함으로써 타겟팅된 피드백이 가능하다.
- 역사적 데이터 분석 결과, 시험 점수가 향상될수록 낭비된 시도와 오랜 시간 동안 틀린 문제 수 등 바람직하지 않은 행동이 감소하는 경향을 보이며, 이는 피드백이 행동에 영향을 줄 수 있음을 시사한다.
- RNN 모델이 가장 뛰어난 예측 성능를 보였지만 잔차 분석 결과 부드럽지 못한 패턴이 확인되어 향후 아키텍처 및 설명 가능성 간의 트레이드오프에 대한 추가 연구가 필요하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.