Skip to main content
QUICK REVIEW

[论文解读] Automatic Recognition of Student Engagement using Deep Learning and Facial Expression

Omid Mohamad Nezami, Mark Dras|arXiv (Cornell University)|Aug 7, 2018
Emotion and Mood Recognition被引用 6
一句话总结

该论文提出了一种基于面部表情的深度学习模型,用于自动识别学生参与度,通过在通用面部表情数据集(FER-2013)上进行预训练,以缓解参与度识别中数据稀缺的问题。所提出的“参与度模型”在新收集的4,627张样本数据集上取得了72.38%的准确率、73.90%的F1值和73.74%的AUC,相较于CNN、VGGNet和HOG+SVM基线模型分别提升了超过6%、3%和10%。

ABSTRACT

Engagement is a key indicator of the quality of learning experience, and one that plays a major role in developing intelligent educational interfaces. Any such interface requires the ability to recognise the level of engagement in order to respond appropriately; however, there is very little existing data to learn from, and new data is expensive and difficult to acquire. This paper presents a deep learning model to improve engagement recognition from images that overcomes the data sparsity challenge by pre-training on readily available basic facial expression data, before training on specialised engagement data. In the first of two steps, a facial expression recognition model is trained to provide a rich face representation using deep learning. In the second step, we use the model's weights to initialize our deep learning based model to recognize engagement; we term this the engagement model. We train the model on our new engagement recognition dataset with 4627 engaged and disengaged samples. We find that the engagement model outperforms effective deep learning architectures that we apply for the first time to engagement recognition, as well as approaches using histogram of oriented gradients and support vector machines.

研究动机与目标

  • 解决教育环境中学生参与度识别中标签数据有限的挑战。
  • 开发一种深度学习模型,利用通用面部表情数据中的丰富面部表征,以提升参与度识别性能。
  • 创建一个新数据集(ER数据集),具有行为与情绪两个维度的心理学指导性标注,用于参与度识别。
  • 展示利用深度神经网络从基础面部表情识别迁移学习到参与度识别的有效性。

提出的方法

  • 在FER-2013数据集上预训练卷积神经网络(CNN),以学习基本情绪的丰富面部表征。
  • 微调预训练模型的权重,以初始化一个专用于参与度识别的新深度学习模型,称为“参与度模型”。
  • 在新收集的4,627张图像数据集上训练参与度模型,标签分为参与或不参与,并将标注分离为行为与情绪两个维度。
  • 利用从大规模面部表情数据集中学习到的特征,通过迁移学习提升在小规模参与度专用数据集上的性能。
  • 使用标准指标(准确率、F1值、AUC)评估模型性能,并与HOG+SVM、标准CNN和VGGNet基线模型进行比较。
  • 通过混淆矩阵分析评估各类别的性能表现,尤其关注具有较高视觉变异性的不参与样本。

实验结果

研究问题

  • RQ1尽管参与度标注数据有限,基于通用面部表情数据的预训练是否能提升学生参与度识别的性能?
  • RQ2从面部表情特征微调得到的深度学习模型是否优于传统手工设计特征(如HOG)和标准CNN在参与度识别中的表现?
  • RQ3所提出的模型在区分具有更高面部与姿态变异性的不参与状态方面有多有效?
  • RQ4双标注方法(行为与情绪维度)在多大程度上提升了参与度标注的可靠性与可解释性?

主要发现

  • 参与度模型在测试集上取得了72.38%的分类准确率,优于表现第二好的模型(CNN)超过6%,优于HOG+SVM达12.5%。
  • 该模型取得了73.90%的F1值,相比深度基线模型提升了3%,相比HOG+SVM提升了6%。
  • 在AUC指标上,参与度模型达到73.74%,相比CNN和VGGNet模型提升了5%,相比HOG+SVM提升了10%。
  • 参与度模型在识别不参与样本方面实现了60.42%的精确率,相比HOG+SVM提升了27%,凸显其在处理复杂视觉变化方面的优势。
  • 混淆矩阵分析表明,深度模型(尤其是参与度模型)在识别不参与状态方面显著更有效,因其能够捕捉多样的面部与姿态线索。
  • 本研究证明,从通用面部表情数据进行迁移学习是提升低数据环境下参与度识别性能的高效策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。