Skip to main content
QUICK REVIEW

[논문 리뷰] PEEK: A Large Dataset of Learner Engagement with Educational Videos

Sahan Bulathwela, María Pérez‐Ortiz|arXiv (Cornell University)|2021. 09. 03.
Online Learning and Analytics참고 문헌 54인용 수 4
한 줄 요약

PEEK는 학습자 참여도를 교육 비디오 조각과 연결하여 설명 가능한 개인화를 위한 지식 주제(위키백과 기반)를 제공하는 대규모 공개 데이터셋이다. 이는 참여도 예측 모델의 벤치마킹을 가능하게 하며, 실험 결과 TrueLearn Novel과 같은 시계열 인식 모델이 최첨단 성능을 보이며, 향후 세대 교육 추천 시스템에 가치를 지닌다.

ABSTRACT

Educational recommenders have received much less attention in comparison to e-commerce and entertainment-related recommenders, even though efficient intelligent tutors have great potential to improve learning gains. One of the main challenges in advancing this research direction is the scarcity of large, publicly available datasets. In this work, we release a large, novel dataset of learners engaging with educational videos in-the-wild. The dataset, named Personalised Educational Engagement with Knowledge Topics PEEK, is the first publicly available dataset of this nature. The video lectures have been associated with Wikipedia concepts related to the material of the lecture, thus providing a humanly intuitive taxonomy. We believe that granular learner engagement signals in unison with rich content representations will pave the way to building powerful personalization algorithms that will revolutionise educational and informational recommendation systems. Towards this goal, we 1) construct a novel dataset from a popular video lecture repository, 2) identify a set of benchmark algorithms to model engagement, and 3) run extensive experimentation on the PEEK dataset to demonstrate its value. Our experiments with the dataset show promise in building powerful informational recommender systems. The dataset and the support code is available publicly.

연구 동기 및 목표

  • 개인화된 교육 추천을 위한 대규모 공개 데이터셋의 부족을 해결하기 위해 새로운 가용성과 확장성을 갖춘 데이터셋을 구축한다.
  • 인간이 직관적으로 이해할 수 있는 지식 구성 요소와 연결된 세분화되고 시간 해상도가 높은 참여 신호를 제공함으로써 개인화 학습 시스템에 대한 연구를 가능하게 한다.
  • 비공식 온라인 학습 환경에서 학습자 참여도를 예측하기 위한 자료 효율적이고 해석 가능하며 시계열 인식 모델의 개발을 촉진한다.
  • 교육 비디오 데이터를 위키백과의 бог후 지식 구조와 연결하여 설명 가능하고 의미론적으로 기반을 둔 학습자 모델링을 지원한다.
  • 기준 알고리즘과 함께 공식적인 벤치마킹 프레임워크를 구축하여 비디오 조각에 대한 학습자 참여도 예측 성능 평가를 가능하게 한다.

제안 방법

  • 공개 교육 자료 저장소에서 확보한 10,200개 이상의 고유한 교육 비디오 강의를 바탕으로 PEEK 데이터셋을 구축한다.
  • 각 비디오를 조각으로 나누고, 음성 인식을 수행한 후 핵심 개념을 실체 연결을 통해 위키백과 페이지와 연결하여 의미론적 기반을 확보한다.
  • 각 비디오 조각을 원자 수준의 위키백과 개념으로 표현하여 지식 구성 요소(KCs)로 사용함으로써 인간이 직관적으로 이해할 수 있는 콘텐츠 표현 방식을 제공한다.
  • 개별 사용자의 시청 시간을 정규화하고, 이진 레이블(참여 또는 비참여)로 이산화하여 지도 학습 기반의 참여도 예측 작업을 정의한다.
  • 지식 추적, IRT, TrueLearn와 같은 딥러닝 모델을 포함한 다양한 기준 모델을 적용하여 비디오 조각 데이터 기반의 참여도를 예측한다.
  • 위키백과의 계층적 구조(카테고리 트리, 하이퍼링크, 의미적 유사성)를 활용하여 콘텐츠 표현을 풍부화하고 지식 그래프 기반 모델링을 지원한다.

실험 결과

연구 질문

  • RQ1학습자 참여도에 대한 대규모 공개 데이터셋이 교육 추천 시스템의 개발을 향상시킬 수 있는가?
  • RQ2위키백과에서 파생된 인간이 직관적으로 이해할 수 있는 지식 구성 요소를 사용할 경우, 다양한 기준 모델의 참여도 예측 성능는 얼마나 효과적인가?
  • RQ3시계열 인식 모델이 정적 또는 유사도 기반 모델에 비해 동적인 학습자 참여 패턴을 얼마나 잘 포착하는가?
  • RQ4위키백과의 지식 구조(예: 카테고리 트리, 의미적 유사성)의 통합이 참여도 예측 모델의 성능 향상과 해석 가능성에 기여하는가?
  • RQ5이 데이터셋에서 지식 구성 요소의 동시 발생 패턴을 분석함으로써 학습자 행동, 지식 경로, 사전 지식 관계에 대한 통찰을 얻을 수 있는가?

주요 결과

  • PEEK 데이터셋은 20,000명 이상의 학습자가 10,200개 이상의 교육 비디오 조각과 상호작용하며, 각 조각이 위키백과 기반 지식 구성 요소와 연결되어 있어, 공개된 교육 참여 데이터셋 중 가장 대규모 중 하나이다.
  • TrueLearn Novel 모델이 참여도 예측에서 뛰어난 성능을 보였으며, 이는 학습자 상태의 시계열 인식 모델링이 정적 또는 유사도 기반 기준 모델에 비해 예측 정확도를 크게 향상시킨다는 것을 시사한다.
  • 데이터셋은 관심 감소 및 변화하는 학습자 선호도와 같은 시계열 역학을 모델링할 수 있도록 지원하며, 순차적 모델의 뛰어난 성능으로 이를 입증한다.
  • 위키백과에 기반한 인간이 직관적으로 이해할 수 있는 지식 구성 요소는 메타인지 및 자기조절 기반 학습 시스템을 지원하는 설명 가능한 학습자 모델을 가능하게 한다.
  • 위키백과의 지식 구조(예: 카테고리 트리, 의미적 유사성)의 통합은 콘텐츠 표현을 향상시키며, 사전 지식 관계 모델링 및 지식 그래프 기반 추천의 길을 열어준다.
  • 이 데이터셋은 참여도 예측 이외의 다양한 연구 과제를 가능하게 하며, 지식 구조 탐색, 학습자 군집화, 조각 수준 집계를 통한 개인화된 비디오 추천 등이 포함된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.