Skip to main content
QUICK REVIEW

[论文解读] PEEK: A Large Dataset of Learner Engagement with Educational Videos

Sahan Bulathwela, María Pérez‐Ortiz|arXiv (Cornell University)|Sep 3, 2021
Online Learning and Analytics参考文献 54被引用 4
一句话总结

PEEK 是一个大规模、公开可用的数据集,记录了学习者对教育视频片段的参与行为,将观看时间互动与基于维基百科的知识主题相链接,以实现可解释的个性化推荐。该数据集支持参与度预测模型的基准测试,实验表明,如 TrueLearn Novel 等时间感知模型表现出当前最先进性能,凸显其在下一代教育推荐系统中的价值。

ABSTRACT

Educational recommenders have received much less attention in comparison to e-commerce and entertainment-related recommenders, even though efficient intelligent tutors have great potential to improve learning gains. One of the main challenges in advancing this research direction is the scarcity of large, publicly available datasets. In this work, we release a large, novel dataset of learners engaging with educational videos in-the-wild. The dataset, named Personalised Educational Engagement with Knowledge Topics PEEK, is the first publicly available dataset of this nature. The video lectures have been associated with Wikipedia concepts related to the material of the lecture, thus providing a humanly intuitive taxonomy. We believe that granular learner engagement signals in unison with rich content representations will pave the way to building powerful personalization algorithms that will revolutionise educational and informational recommendation systems. Towards this goal, we 1) construct a novel dataset from a popular video lecture repository, 2) identify a set of benchmark algorithms to model engagement, and 3) run extensive experimentation on the PEEK dataset to demonstrate its value. Our experiments with the dataset show promise in building powerful informational recommender systems. The dataset and the support code is available publicly.

研究动机与目标

  • 通过创建一种新颖且可扩展的数据集,解决个性化教育推荐领域中大规模、公开可用数据集稀缺的问题。
  • 通过提供与人类直观知识组件相关联的细粒度、时间解析的参与信号,推动个性化学习系统的研究。
  • 促进数据高效、可解释且具备时间感知能力的模型开发,以预测非正式在线学习环境中的学习者参与度。
  • 将教育视频数据与维基百科的丰富知识结构相连接,支持可解释且语义基础扎实的学习者建模。
  • 建立正式的基准测试框架及基线算法,用于评估学习者对视频片段参与度预测的性能表现。

提出的方法

  • 从一个开放教育资源库中收集超过 10,200 个独特的教育视频讲座,构建 PEEK 数据集。
  • 将每个视频分割为片段,进行语音转录,并通过实体链接将关键概念与维基百科页面关联,以实现语义定位。
  • 使用原子维基百科概念作为知识组件(KCs)表示每个视频片段,实现人类直观的内容表征。
  • 对个体用户观看时间进行归一化,并离散化为二元标签(参与或未参与),以定义监督式参与度预测任务。
  • 应用一系列基线模型——包括知识追踪、IRT 以及 TrueLearn 等深度学习模型——来预测在视频片段上的参与度。
  • 利用维基百科的分层结构(类别树、超链接及语义相关性)丰富内容表征,支持基于知识图谱的建模。

实验结果

研究问题

  • RQ1大规模、公开可用的学习者对教育视频片段参与度数据集能否提升个性化教育推荐系统的发展?
  • RQ2当使用源自维基百科的人类直观知识组件时,不同基线模型在预测学习者参与度方面的有效性如何?
  • RQ3时间感知模型在捕捉动态学习者参与模式方面,相较于静态或基于相似度的模型,优势有多大?
  • RQ4将维基百科的知识结构(如类别树、语义相关性)整合进来,能否提升参与度预测模型的性能与可解释性?
  • RQ5从数据集中知识组件的共现模式中,可以对学习者行为、知识路径及先决条件结构获得哪些洞见?

主要发现

  • PEEK 数据集包含超过 20,000 名学习者与超过 10,200 个教育视频片段的互动,每个片段均与基于维基百科的知识组件相链接,构成目前公开可用的最大规模教育参与度数据集之一。
  • TrueLearn Novel 模型在参与度预测中表现最优,表明对学习者状态的时间感知建模显著提升了预测准确率,优于静态或基于相似度的基线模型。
  • 该数据集支持对时间动态性的建模,如兴趣衰减与学习者偏好的演变,这从序列模型的优异表现中得到验证。
  • 基于维基百科的人类直观知识组件使学习者模型具备可解释性,支持学习系统中的元认知与自我调节。
  • 将维基百科的知识结构(如类别树、语义相关性)整合进来,增强了内容表征,并为建模先决条件关系与基于知识图谱的推荐开辟了新途径。
  • 该数据集支持超越参与度预测的多样化研究任务,包括知识结构发现、学习者聚类,以及通过片段级聚合实现的个性化视频推荐。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。