Skip to main content
QUICK REVIEW

[论文解读] Spotting Macro- and Micro-expression Intervals in Long Video Sequences

Ying He, Sujing Wang|arXiv (Cornell University)|Dec 18, 2019
Gaze Tracking and Assistive Technology参考文献 27被引用 5
一句话总结

本文提出了一种基线方法,利用主方向最大差分分析(MDMD)在长视频序列中检测宏观和微观表情,该方法通过光流差异检测面部运动,并将单帧预测后处理为时间区间。该方法在CAS(ME)²数据集上取得0.1196(宏观)和0.0082(微观)的F1分数,在SAMM Long Videos数据集上取得0.0629(宏观)和0.0364(微观)的F1分数,尽管误报率较高,但仍证明了其初步可行性。

ABSTRACT

This paper presents baseline results for the Third Facial Micro-Expression Grand Challenge (MEGC 2020). Both macro- and micro-expression intervals in CAS(ME)$^2$ and SAMM Long Videos are spotted by employing the method of Main Directional Maximal Difference Analysis (MDMD). The MDMD method uses the magnitude maximal difference in the main direction of optical flow features to spot facial movements. The single-frame prediction results of the original MDMD method are post-processed into reasonable video intervals. The metric F1-scores of baseline results are evaluated: for CAS(ME)$^2$, the F1-scores are 0.1196 and 0.0082 for macro- and micro-expressions respectively, and the overall F1-score is 0.0376; for SAMM Long Videos, the F1-scores are 0.0629 and 0.0364 for macro- and micro-expressions respectively, and the overall F1-score is 0.0445. The baseline project codes are publicly available at https://github.com/HeyingGithub/Baseline-project-for-MEGC2020_spotting.

研究动机与目标

  • 解决在长视频序列中检测宏观和微观表情的挑战,这些表情在孤立分析时常常被忽略。
  • 为第三届面部微观表情大挑战(MEGC 2020)提供基线解决方案,重点在于时间区间检测而非帧级分类。
  • 通过将单帧预测后处理为连贯的时间区间,改进原始MDMD方法,以更好地匹配真实表情持续时间。
  • 使用0.5 IoU阈值进行区间级F1分数评估,以确保对标注不准确的鲁棒性。
  • 通过在两个基准数据集CAS(ME)²和SAMM Long Videos上标准化评估指标和真实标签定义,实现方法间的公平比较。

提出的方法

  • 应用主方向最大差分分析(MDMD)计算连续帧之间光流特征主方向上最大差分的幅值。
  • 将MDMD得分用作帧级面部运动强度指标,较高值表示可能存在表情起始。
  • 通过将相邻被预测为运动的帧分组为连续区间,对帧级预测进行后处理。
  • 基于最小和最大长度阈值过滤区间:CAS(ME)²为16帧,SAMM Long Videos为105帧,以去除不切实际的短或长区间。
  • 调整阈值参数$p$以控制MDMD预测的敏感度,最终选择$p = 0.01$作为最优基线设置。
  • 使用0.5交并比(IoU)阈值定义真正例,即预测区间与真实标签区间之间的重叠程度,以确保与人工标注的表情窗口对齐。

实验结果

研究问题

  • RQ1MDMD方法是否能在不依赖预分割数据的情况下,有效检测长视频序列中的宏观和微观表情区间?
  • RQ2在MDMD中调整阈值$p$如何影响不同数据集上表情检测的精确率与召回率之间的平衡?
  • RQ3将帧级预测后处理为区间在多大程度上提升了对时间上连贯的面部表情的检测能力?
  • RQ4当前基线方法与最先进方法在长视频中检测宏观和微观表情方面存在多大性能差距?
  • RQ5考虑到分辨率、帧率和表情持续时间的差异,基线方法在CAS(ME)²和SAMM Long Videos数据集上的F1分数表现如何?

主要发现

  • 在CAS(ME)²数据集上,基线方法在宏观表情检测中取得0.1196的F1分数,在微观表情检测中取得0.0082的F1分数。
  • 在SAMM Long Videos数据集上,宏观表情的F1分数为0.0629,微观表情为0.0364,表明宏观表情检测率更高。
  • CAS(ME)²上的总体F1分数为0.0376,SAMM Long Videos上的总体F1分数为0.0445,整体性能较低,主要由于误报率较高。
  • 随着$p$值增加,真正例数量减少,而在CAS(ME)²上F1分数先上升后下降,峰值出现在$p = 0.12$左右,但最终选择最低的$p$值($p = 0.01$)作为基线结果。
  • 两个数据集上的精确率均较低——CAS(ME)²上宏观表情为0.0716,微观表情为0.0042,表明存在大量误报。
  • SAMM Long Videos上微观表情的召回率(0.1824)高于CAS(ME)²(0.3684),尽管F1分数较低,表明该数据集对微观表情的检测效果更好。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。