[论文解读] Recognizing Micro-Expression in Video Clip with Adaptive Key-Frame Mining
本文提出AKMNet,一种端到端深度学习模型,通过自适应地从微表情视频片段中挖掘关键帧,以捕捉具有区分性的时空特征。通过结合自学习的局部关键帧及其全局时间动态,AKMNet在基准数据集上实现了优于当前最先进方法的识别准确率,且无需依赖专家标注的峰值帧。
As a spontaneous expression of emotion on face, micro-expression reveals the underlying emotion that cannot be controlled by human. In micro-expression, facial movement is transient and sparsely localized through time. However, the existing representation based on various deep learning techniques learned from a full video clip is usually redundant. In addition, methods utilizing the single apex frame of each video clip require expert annotations and sacrifice the temporal dynamics. To simultaneously localize and recognize such fleeting facial movements, we propose a novel end-to-end deep learning architecture, referred to as adaptive key-frame mining network (AKMNet). Operating on the video clip of micro-expression, AKMNet is able to learn discriminative spatio-temporal representation by combining spatial features of self-learned local key frames and their global-temporal dynamics. Theoretical analysis and empirical evaluation show that the proposed approach improved recognition accuracy in comparison with state-of-the-art methods on multiple benchmark datasets.
研究动机与目标
- 解决微表情识别中全视频表示的冗余问题。
- 克服依赖专家标注峰值帧且损失时间动态的单峰值帧方法的局限性。
- 开发一种端到端框架,自动定位并识别微表情中转瞬即逝的面部动作。
- 通过结合局部关键帧及其全局时间上下文,学习具有区分性的时空表征。
- 在减少对手动标注依赖的同时,提升识别准确率。
提出的方法
- AKMNet采用自适应关键帧挖掘模块,基于学习到的时空重要性,从微表情视频片段中识别显著帧。
- 网络使用卷积主干网络从自识别的关键帧中提取空间特征。
- 通过时间建模模块对挖掘出的关键帧序列特征进行聚合,以建模时间动态。
- 网络架构采用端到端训练,联合优化关键帧选择与情绪分类。
- 采用对比损失以增强不同情绪类别之间的特征判别性。
- 模型同时利用局部外观特征与全局时间上下文,以提升表征学习效果。
实验结果
研究问题
- RQ1与全视频或峰值帧基线方法相比,自适应关键帧挖掘是否能提升微表情识别准确率?
- RQ2所提出方法是否在保留时间动态的同时,降低了对专家标注峰值帧的依赖?
- RQ3自学习的关键帧是否能捕捉到比固定或人工选择帧更具区分性的时空特征?
- RQ4局部关键帧与全局时间建模的结合如何增强微表情识别的特征表征?
- RQ5在标准基准数据集上,AKMNet相较于当前最先进方法的性能提升如何?
主要发现
- AKMNet在多个基准数据集(包括SMAPE和CASME II)上实现了高于当前最先进方法的识别准确率。
- 该模型通过自适应关键帧选择,在无需专家标注峰值帧的情况下,优于现有方法。
- 实证评估证实,自学习关键帧与时间建模的结合可提升特征判别性。
- 理论分析表明,自适应挖掘机制在捕捉瞬时面部动作方面具有有效性。
- 消融实验验证了空间特征学习与时间动态建模对整体性能的贡献。
- 该方法在多种多样的微表情数据集上表现出鲁棒性,表明其具备良好的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。