Skip to main content
QUICK REVIEW

[论文解读] Class-attention Video Transformer for Engagement Intensity Prediction

Xusheng Ai, Victor S. Sheng|arXiv (Cornell University)|Aug 12, 2022
Online Learning and Analytics被引用 4
一句话总结

本文提出类注意力视频Transformer(CavT),一种端到端的视频Transformer模型,通过类注意力机制从视频帧中预测参与度强度,实现了最先进性能。此外,本文还引入二元顺序代表采样(BorS)以增强训练数据的多样性与帧利用率,在EmotiW-EP上将误差降低至0.0495 MSE,在DAiSEE上降低至0.0377 MSE。

ABSTRACT

In order to deal with variant-length long videos, prior works extract multi-modal features and fuse them to predict students' engagement intensity. In this paper, we present a new end-to-end method Class Attention in Video Transformer (CavT), which involves a single vector to process class embedding and to uniformly perform end-to-end learning on variant-length long videos and fixed-length short videos. Furthermore, to address the lack of sufficient samples, we propose a binary-order representatives sampling method (BorS) to add multiple video sequences of each video to augment the training set. BorS+CavT not only achieves the state-of-the-art MSE (0.0495) on the EmotiW-EP dataset, but also obtains the state-of-the-art MSE (0.0377) on the DAiSEE dataset. The code and models have been made publicly available at https://github.com/mountainai/cavt.

研究动机与目标

  • 解决使用端到端模型在长且长度可变的在线视频中预测参与度强度的挑战。
  • 克服现有基于视频的参与度预测方法中存在的帧利用率低和泛化能力差的问题。
  • 通过有效的数据增强方法缓解参与度预测数据集中数据稀缺与类别不平衡的问题。
  • 将Transformer架构——特别是自注意力与类注意力机制——适配于视频中细粒度参与度强度回归任务。
  • 开发一种采样策略,以提升模型在不同长度与内容视频中的鲁棒性与性能。

提出的方法

  • 提出类注意力视频Transformer(CavT),通过可学习的类标记与视觉块之间的类注意力机制,聚合时空特征以实现回归。
  • 采用标准的ViT风格架构,包含可学习的位置嵌入,并在展平后的视频帧上应用多头自注意力机制。
  • 提出二元顺序代表采样(BorS),一种数据增强方法,将视频序列划分为滑动窗口,并利用二元顺序逻辑选择代表性帧。
  • BorS通过二元有序方式从中间或子窗口中选择帧,自适应地为每段输入视频生成多个视频序列,以确保分布均匀。
  • 将CavT与BorS结合,训练单一端到端模型,使其在可变长度视频上具有良好泛化能力,并提升长序列上的性能。
  • 使用均方误差(MSE)与平均绝对误差(MAE)作为评估指标,并对人脸提取、类别权重与采样超参数进行消融实验。

实验结果

研究问题

  • RQ1基于Transformer的架构结合类注意力机制,能否在无需手工特征的情况下,仅从原始视频帧中有效预测连续的参与度强度?
  • RQ2所提出的BorS采样策略相较于随机采样,在提升模型泛化能力与参与度预测任务性能方面表现如何?
  • RQ3当训练数据有限或存在类别不平衡时,BorS在多大程度上能提升模型性能?
  • RQ4在CavT框架中,人脸提取是否能提升参与度强度预测性能?
  • RQ5对于EmotiW-EP与DAiSEE等基准数据集,BorS中采样次数(r)的最优值是多少?

主要发现

  • BorS+CavT在EmotiW-EP数据集上实现了SOTA的MSE为0.0495,优于先前方法。
  • 在DAiSEE数据集上,BorS+CavT实现了新的SOTA MSE为0.0377,表明其在不同长度视频中具有强大的泛化能力。
  • 消融实验表明,人脸提取可提升CavT性能,使EmotiW-EP上的MSE从0.0759降低至0.0667。
  • 加权损失未能提升CavT性能,甚至导致MMSE上升,表明仅通过损失加权无法有效缓解类别不平衡问题。
  • BorS的最优采样次数为:EmotiW-EP上r=4,DAiSEE上r=3,超过此值后性能因过拟合而下降。
  • BorS相比随机采样提升0.0157 MSE(0.0495 vs. 0.0652),证明了结构化、二元顺序帧选择的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。