[论文解读] Objective Class-based Micro-Expression Recognition through Simultaneous Action Unit Detection and Feature Aggregation
该论文提出MER-auGCN,一种深度学习模型,通过图卷积网络(GCN)同时检测面部动作单元(AUs)并将AU级特征聚合为微表情级表征。通过整合自注意力机制与平衡损失函数以实现统一的AU特征学习,并利用定制的AU知识图谱,该模型在MEGC 2018的HDE和CDE任务中均取得最先进性能,CDE任务的加权平均召回率(WAR)达86.7%,加权F1分数(WF1)达74.2%。
Micro-Expression Recognition (MER) is a challenging task as the subtle changes occur over different action regions of a face. Changes in facial action regions are formed as Action Units (AUs), and AUs in micro-expressions can be seen as the actors in cooperative group activities. In this paper, we propose a novel deep neural network model for objective class-based MER, which simultaneously detects AUs and aggregates AU-level features into micro-expression-level representation through Graph Convolutional Networks (GCN). Specifically, we propose two new strategies in our AU detection module for more effective AU feature learning: the attention mechanism and the balanced detection loss function. With those two strategies, features are learned for all the AUs in a unified model, eliminating the error-prune landmark detection process and tedious separate training for each AU. Moreover, our model incorporates a tailored objective class-based AU knowledge-graph, which facilitates the GCN to aggregate the AU-level features into a micro-expression-level feature representation. Extensive experiments on two tasks in MEGC 2018 show that our approach significantly outperforms the current state-of-the-arts in MER. Additionally, we also report our single model-based micro-expression AU detection results.
研究动机与目标
- 为解决基于情绪的微表情识别存在的主观性与自评标签不一致的问题。
- 通过在统一模型中直接学习AU特征,消除依赖面部关键点检测的易错且繁琐的过程。
- 通过基于图建模的特征聚合,将局部AU级特征整合为全局微表情级表征,以提升微表情识别性能。
- 通过端到端联合优化实现AU检测与MER的联合学习,避免对每个AU单独训练。
- 提供一种可扩展的单模型解决方案,用于AU检测与MER,具备跨数据库泛化能力,并支持未来扩展至更多AU。
提出的方法
- 提出一个统一的深度神经网络,实现AU检测与微表情识别的同步处理,无需单独的AU模型。
- 在AU检测模块中引入自注意力机制,通过聚焦于不同AU的判别性区域来增强特征学习。
- 采用平衡检测损失函数,缓解AU检测中的类别不平衡问题,提升对罕见AU与常见AU的泛化能力。
- 构建定制的基于客观类别的AU知识图谱,将AUs与MER类别I–V关联,编码AU与客观标签之间的先验关系。
- 利用图卷积网络(GCN)基于知识图谱作为关系先验,将AU级特征聚合为全局微表情级表征。
- 处理TV-L1光流输入,突出运动动态特征,降低身份偏差,提升跨数据库泛化能力。
实验结果
研究问题
- RQ1是否能够通过统一的深度学习模型在不依赖关键点检测或为每个AU单独训练的前提下,有效检测微表情中的多个动作单元(AUs)?
- RQ2与顺序或独立训练相比,联合学习AU检测与微表情识别在性能上是否具有显著提升?
- RQ3在基于客观类别的MER中,引入AU关系知识图谱在多大程度上能增强特征聚合与识别准确率?
- RQ4所提出的模型在跨数据集评估中是否具备在不同数据库(如CASME II与SAMM)间的泛化能力?
- RQ5AU检测与MER损失的端到端联合优化是否能带来优于现有最先进方法的AU检测性能?
主要发现
- MER-auGCN在MEGC 2018的HDE任务中实现了86.7%的加权平均召回率(WAR),超越所有先前的最先进方法。
- 在CDE任务中,该模型实现了74.2%的加权F1分数(WF1),创下新的最先进性能记录。
- 与文献[14]中的光流方法相比,WAR提升了0.25个百分点,证明了联合AU检测与基于GCN的特征聚合的优势。
- AU检测模块在七个AUs上的平均F1得分为59.16%,优于相同基准上STAPF方法的56.20%,且仅使用单一统一模型。
- 该模型在跨数据库泛化方面表现强劲,在SAMM→CASME II折叠的AU检测任务中取得优异性能。
- 消融实验确认,自注意力机制与平衡损失函数均对AU特征学习与整体性能有显著贡献。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。