[논문 리뷰] EdNet: A Large-Scale Hierarchical Dataset in Education
EdNet는 2년간 Santa AI 튜터링 플랫폼에서 수집한 784,000명의 학생들로부터 131백만 건의 상호작용을 포함하는 대규모이자 계층적인 교육 데이터셋이다. 이 데이터셋은 문제 해결, 강의 시청, 과정 구매 등의 다양한 학습 활동을 포함하며, 지식 추적 및 학습 경로 추천과 같은 다수의 과제를 위한 다수준 추상화를 가능하게 하는 계층적 구조를 지닌다. EdNet는 이미 지식 추적, 졸업 유예 예측, 레이블 부족 과제를 위한 사전 훈련 등 분야에서 최첨단 모델 개발을 가능하게 하였다.
With advances in Artificial Intelligence in Education (AIEd) and the ever-growing scale of Interactive Educational Systems (IESs), data-driven approach has become a common recipe for various tasks such as knowledge tracing and learning path recommendation. Unfortunately, collecting real students' interaction data is often challenging, which results in the lack of public large-scale benchmark dataset reflecting a wide variety of student behaviors in modern IESs. Although several datasets, such as ASSISTments, Junyi Academy, Synthetic and STATICS, are publicly available and widely used, they are not large enough to leverage the full potential of state-of-the-art data-driven models and limits the recorded behaviors to question-solving activities. To this end, we introduce EdNet, a large-scale hierarchical dataset of diverse student activities collected by Santa, a multi-platform self-study solution equipped with artificial intelligence tutoring system. EdNet contains 131,441,538 interactions from 784,309 students collected over more than 2 years, which is the largest among the ITS datasets released to the public so far. Unlike existing datasets, EdNet provides a wide variety of student actions ranging from question-solving to lecture consumption and item purchasing. Also, EdNet has a hierarchical structure where the student actions are divided into 4 different levels of abstractions. The features of EdNet are domain-agnostic, allowing EdNet to be extended to different domains easily. The dataset is publicly released under Creative Commons Attribution-NonCommercial 4.0 International license for research purposes. We plan to host challenges in multiple AIEd tasks with EdNet to provide a common ground for the fair comparison between different state of the art models and encourage the development of practical and effective methods.
연구 동기 및 목표
- 현대적 상호작용 교육 시스템(IES)에서 실제 학생 행동을 반영하는 대규모, 다양한, 공개 가능한 교육 상호작용 데이터셋의 부족을 해결하기 위해.
- 지식 추적, 학습 경로 추천, 졸업 유예 예측과 같은 다양한 과제를 지원하는 AI 교육(AIEd)을 위한 종합적인 벤치마크를 제공하기 위해.
- 확장 가능하고 도메인에 종속되지 않으며 계층적인 데이터셋 구조를 통해 최첨단 데이터 기반 모델의 개발과 공정한 비교를 가능하게 하기 위해.
제안 방법
- EdNet는 TOEIC 시험 준비를 위한 다중 플랫폼 AI 튜터링 시스템인 Santa에서 수집한 세밀한 학생 상호작용 로그를 수집한다.
- 이 데이터셋은 네 단계의 추상화 수준으로 계층적으로 구성되어 있어 연구자가 학생 행동을 다양한 해상도로 모델링할 수 있도록 한다.
- 일반적인 평가 로그를 넘어서 문제 해결, 강의 소비, 선택지 제거, 제품 구매 등의 다양한 행동을 기록한다.
- 연구 및 벤치마크 지원을 위해 비영리 Creative Commons 라이선스 하에 공개 배포된다.
- 연구자들은 EdNet를 사용해 SAINT(Transformer 기반 지식 추적자) 및 DAS(학습 세션 졸업 유예 예측을 위한 Transformer)와 같은 모델을 훈련하고 평가한다.
- 계층적 설계는 강화학습 기반 학습 경로 추천을 위한 다양한 정밀도를 가진 시뮬레이터 구축을 지원한다.
실험 결과
연구 질문
- RQ1대규모, 다양한, 계층적인 교육 데이터셋이 교육 분야의 데이터 기반 AI 모델의 성능 향상과 일반화 능력 향상에 어떻게 기여할 수 있는가?
- RQ2단순한 정답 레이블 외에도 세밀한 상호작용 로그가 포착하는 학생 학습의 핵심 행동 패턴은 무엇인가?
- RQ3EdNet의 계층적 구조는 학생 지식 상태와 학습 궤적을 더 민첩하고 확장 가능한 방식으로 모델링하는 데 어떻게 기여하는가?
- RQ4EdNet에서의 사전 훈련이 시험 점수 예측 및 리뷰 정확도 예측과 같은 레이블이 부족한 교육 과제에서 성능 향상에 기여할 수 있는가?
- RQ5EdNet 기반으로 구축된 시뮬레이터가 개인화된 학습 경로 추천을 위한 강화학습 에이전트의 효과적인 훈련을 얼마나 잘 지원할 수 있는가?
주요 결과
- EdNet는 784,309명의 학생으로부터 총 131,441,538건의 상호작용을 포함하고 있어 현재까지 공개된 IES 데이터셋 중 가장 크다.
- 이 데이터셋은 13,169개의 고유 문제와 1,021개의 강의를 기록하고 있으며, 9,500만 건 이상의 문제 해결 상호작용과 60만 건 이상의 강의 시청 기록을 포함한다.
- EdNet-KT1에서 훈련된 SAINT 모델은 AUROC에서 뚜렷한 향상을 보이며 지식 추적 분야에서 최첨단 성능을 달성하였다.
- EdNet-KT4에서의 학습 세션 졸업 유예 예측을 위한 DAS 모델은 기존 모델들을 능가하며 세밀한 시간적 행동 모델링의 가치를 입증하였다.
- EdNet-KT4를 사용한 평가 모델링이라는 사전 훈련 방법은 시험 점수 예측 및 리뷰 정확도 예측 분야에서 최첨단 성능을 기록하였으며, NLP 기반 사전 훈련 방법을 능가하였다.
- EdNet의 계층적 구조는 다양한 정밀도를 가진 시뮬레이터 개발을 가능하게 하여 강화학습 기반 튜터링 전략의 효율적이고 효과적인 훈련을 지원한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.