[论文解读] VLEngagement: A Dataset of Scientific Video Lectures for Evaluating Population-based Engagement
本文介绍了VLEngagement,这是一个大规模、公开可用的数据集,包含来自VideoLectures.NET的4,000多段科学视频讲座,涵盖基于内容、基于维基百科以及视频特异性的特征,以及用户参与度指标。该数据集支持通过新任务实现基于群体的参与度预测与排序,基线模型在集成学习方法下表现出色,支持教育领域中可扩展的质量保证与推荐系统。
With the emergence of e-learning and personalised education, the production and distribution of digital educational resources have boomed. Video lectures have now become one of the primary modalities to impart knowledge to masses in the current digital age. The rapid creation of video lecture content challenges the currently established human-centred moderation and quality assurance pipeline, demanding for more efficient, scalable and automatic solutions for managing learning resources. Although a few datasets related to engagement with educational videos exist, there is still an important need for data and research aimed at understanding learner engagement with scientific video lectures. This paper introduces VLEngagement, a novel dataset that consists of content-based and video-specific features extracted from publicly available scientific video lectures and several metrics related to user engagement. We introduce several novel tasks related to predicting and understanding context-agnostic engagement in video lectures, providing preliminary baselines. This is the largest and most diverse publicly available dataset to our knowledge that deals with such tasks. The extraction of Wikipedia topic-based features also allows associating more sophisticated Wikipedia based features to the dataset to improve the performance in these tasks. The dataset, helper tools and example code snippets are available publicly at https://github.com/sahanbull/context-agnostic-engagement
研究动机与目标
- 为解决缺乏可用于评估科学视频讲座中上下文无关参与度的公开可用数据集的问题。
- 通过在用户反馈出现前预测参与潜力,支持教育领域中可扩展的质量保证与推荐系统。
- 为解决教育推荐系统中新用户与新内容的冷启动问题提供基础支持。
- 支持对多模态特征(文本、视觉、基于维基百科)的研究,以理解驱动科学教育视频参与度的关键因素。
- 基于来自开放教育资源的真实世界数据,建立基于群体的参与度预测与排序的基准。
提出的方法
- 该数据集源自从VideoLectures.NET获取的4,000多段经过同行评审的科学视频讲座,涵盖多样化的知识领域与语言。
- 通过自然语言处理技术,从讲座文稿中提取基于内容的特征,包括句法、语义与词汇模式。
- 通过实体链接技术生成基于维基百科主题的特征,实现与结构化知识的关联,以提升建模效果。
- 提取视频特异性特征,包括音视频与演示文稿的模式,以捕捉多模态参与度线索。
- 通过公开的互动指标(如播放量、点赞数、分享数)收集用户参与度标签,以定义上下文无关的参与度。
- 定义了两个主要任务——参与度预测与排序,并采用集成学习模型作为基线方法。
实验结果
研究问题
- RQ1哪些特征,特别是基于维基百科与基于内容的特征,最能预测科学视频讲座的群体参与度?
- RQ2集成学习模型在从多模态特征中预测上下文无关参与度方面的有效性如何?
- RQ3参与度预测模型在多大程度上可缓解教育推荐系统中的冷启动问题?
- RQ4不同模态(文本、音频、视频、幻灯片)在科学内容参与度预测中的贡献程度如何?
- RQ5该数据集能否支持跨不同教育内容模态的多任务学习与迁移学习?
主要发现
- VLEngagement数据集包含超过4,000段科学视频讲座,内容多样、语言丰富、知识领域广泛,是目前此类用途中规模最大的公开可用数据集。
- 集成学习模型在参与度预测与排序任务中表现优异,证明了自动化参与度估计的可行性。
- 基于维基百科的实体链接整合显著提升了特征表示效果,增强了模型的泛化能力与可解释性。
- 该数据集支持对上下文无关参与度的有效建模,有助于在在线教育中构建可扩展的质量保证与推荐系统。
- 初步结果表明,多模态特征(文本、视觉、音视频)的综合使用可显著提升参与度预测效果,优于单一模态方法。
- 该数据集已公开发布,并附带工具与代码,支持可复现性,推动教育推荐系统领域的未来研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。