[论文解读] MUTLA: A Large-Scale Dataset for Multimodal Teaching and Learning Analytics
本文介绍了MUTLA,这是一个大规模的真实世界多模态数据集,整合了学生在使用Squirrel AI学习系统过程中产生的学习日志、同步的视频记录以及脑电图(EEG)脑波数据。数据采集自中国课后辅导班的真实教学环境,支持对学习者参与度的预测研究,通过行为、生理和交互数据的综合分析,推动自适应学习系统的改进。
Automatic analysis of teacher and student interactions could be very important to improve the quality of teaching and student engagement. However, despite some recent progress in utilizing multimodal data for teaching and learning analytics, a thorough analysis of a rich multimodal dataset coming for a complex real learning environment has yet to be done. To bridge this gap, we present a large-scale MUlti-modal Teaching and Learning Analytics (MUTLA) dataset. This dataset includes time-synchronized multimodal data records of students (learning logs, videos, EEG brainwaves) as they work in various subjects from Squirrel AI Learning System (SAIL) to solve problems of varying difficulty levels. The dataset resources include user records from the learner records store of SAIL, brainwave data collected by EEG headset devices, and video data captured by web cameras while students worked in the SAIL products. Our hope is that by analyzing real-world student learning activities, facial expressions, and brainwave patterns, researchers can better predict engagement, which can then be used to improve adaptive learning selection and student learning outcomes. An additional goal is to provide a dataset gathered from real-world educational activities versus those from controlled lab environments to benefit the educational learning community.
研究动机与目标
- 为解决教学与学习分析领域缺乏公开、高质量、真实世界多模态数据集的问题。
- 支持利用学习行为、面部表情和脑波模式的整合数据进行学生参与度预测研究。
- 提供来自真实课后学习环境而非受控实验室环境的数据集。
- 支持开发能够动态响应学生参与度和认知状态的自适应学习系统。
提出的方法
- 从中国两个Squirrel AI Learning中心的156名学生中收集时间同步的多模态数据。
- 从Squirrel AI Learning系统的学习者记录存储库中获取用户学习日志,记录问题级别的答题情况和能力水平追踪。
- 使用BrainCo头戴设备采集EEG脑波信号,并通过FocusEDU平台存储。
- 在学习会话期间使用网络摄像头捕获视频数据,每位学生的会话均连续录制。
- 通过时间戳、学生ID、会话时间和头戴设备ID对用户记录、EEG数据和视频数据进行同步。
- 基于开始时间(stime)和提交时间(ctime)将视频数据分割为问题级别的片段,形成对齐的多模态数据单元。
实验结果
研究问题
- RQ1如何在真实学习环境中有效同步并结构化多模态数据以支持研究?
- RQ2在解题过程中,学生面部表情、脑波模式与学习参与度之间存在何种关系?
- RQ3EEG和视频数据在多大程度上能够预测自适应学习系统中的学生参与度和学习成果?
- RQ4不同学科和学习任务中,视频追踪质量(如面部可见性)如何变化?
- RQ5与实验室数据相比,真实世界多模态数据集能否提升参与度和认知状态预测模型的准确性?
主要发现
- 该数据集包含六个学科的2170个问题级别片段,物理学科总视频时长为50,790秒,英语学科为25,991秒。
- 61.54%的视频片段至少有50%的有效面部追踪,而仅有18.30%的片段全程完全可见。
- 通过基于时间的匹配算法成功将EEG数据和视频数据与用户记录同步,支持可靠的多模态分析。
- 该数据集包含全面的学习日志、EEG信号和在真实课后学习环境中采集的视频数据。
- 该数据集可通过GitHub公开获取,支持教育人工智能和学习分析领域的可复现研究。
- 真实世界的行为、生理和交互数据的整合,为建模学生参与度和认知状态提供了新机遇。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。