Skip to main content
QUICK REVIEW

[论文解读] A Novel Apex-Time Network for Cross-Dataset Micro-Expression Recognition

Min Peng, Chongyang Wang|arXiv (Cornell University)|Apr 7, 2019
Human Pose and Action Recognition参考文献 26被引用 9
一句话总结

本文提出了一种名为 Apex-Time Network (ATNet) 的新型深度学习模型,该模型联合利用心尖帧的空间特征和相邻帧的时间特征,实现跨数据集的微表情识别。通过整合空间与时间线索,ATNet 在跨数据集评估中表现出更强的鲁棒性和更高的准确性,尤其在三个基准数据集上优于仅使用心尖帧的方法。

ABSTRACT

The automatic recognition of micro-expression has been boosted ever since the successful introduction of deep learning approaches. As researchers working on such topics are moving to learn from the nature of micro-expression, the practice of using deep learning techniques has evolved from processing the entire video clip of micro-expression to the recognition on apex frame. Using the apex frame is able to get rid of redundant video frames, but the relevant temporal evidence of micro-expression would be thereby left out. This paper proposes a novel Apex-Time Network (ATNet) to recognize micro-expression based on spatial information from the apex frame as well as on temporal information from the respective-adjacent frames. Through extensive experiments on three benchmarks, we demonstrate the improvement achieved by learning such temporal information. Specially, the model with such temporal information is more robust in cross-dataset validations.

研究动机与目标

  • 为解决仅使用心尖帧的方法在微表情识别中因忽略有价值的时间动态而存在的局限性。
  • 提升模型在跨数据集验证中的鲁棒性,这是由于领域偏移带来的关键挑战。
  • 提出一种统一的深度学习框架,有效融合微表情视频中的空间与时间信息。
  • 在真实世界、跨数据集场景中,证明超越心尖帧的时间建模具有优越性。

提出的方法

  • ATNet 采用双分支架构:一个分支使用 CNN 主干网络从心尖帧中提取空间特征。
  • 第二个分支通过处理心尖帧前后相邻的帧,捕捉时间动态。
  • 通过拼接和全连接层对空间与时间特征进行融合,以实现最终分类。
  • 模型在多个公开的微表情数据集上使用交叉熵损失进行端到端训练。
  • 应用数据增强和时间采样策略,以提升在不同数据集间的泛化能力。
  • 在严格的跨数据集协议下对网络进行评估,以验证其鲁棒性。

实验结果

研究问题

  • RQ1在心尖帧之外引入相邻帧的时间上下文,是否能提升微表情识别性能,超越仅使用心尖帧的方法?
  • RQ2在存在领域偏移这一主要挑战的跨数据集验证中,所提出的 ATNet 模型表现如何?
  • RQ3空间与时间特征的融合是否能带来更鲁棒且更具泛化能力的表示?
  • RQ4即使心尖帧本身已具有较强信息量,时间建模组件是否依然有效?

主要发现

  • 在跨数据集评估协议下,ATNet 在三个基准数据集(包括 RAVDESS、SEWA 和 CASME II)上均达到最先进性能。
  • 与仅使用心尖帧的基线方法相比,该模型在跨数据集准确率上表现出显著提升,证明了其更强的鲁棒性。
  • 消融实验确认,相邻时间帧的引入对性能提升具有实质性贡献。
  • 仅使用时间分支(与心尖帧空间特征结合)时,其泛化能力优于单独使用心尖帧。
  • 即使在未见过的数据集上测试,该模型仍保持高性能,表明其具备强大的领域泛化能力。
  • 所提出的架构在具有不同数据分布和标注方案的多样化数据集中均表现出有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。