[论文解读] Automatic Facial Paralysis Estimation with Facial Action Units
该论文提出ALGRNet,一种用于基于面部动作单元(AUs)的自动面部瘫痪严重程度评估的新型自适应局部-全局关系网络。通过整合自适应区域学习、AU关系的跳跃-BiLSTM建模以及特征融合与精炼模块,ALGRNet在BP4D和DISFA数据集上实现了最先进的AU检测准确率,并在新收集的面部瘫痪数据集(FPara)上以平均F1得分高出现有方法2.6%,展现出在临床严重程度评估中强大的泛化能力和可迁移性。
Facial palsy is unilateral facial nerve weakness or paralysis of rapid onset with unknown causes. Automatically estimating facial palsy severeness can be helpful for the diagnosis and treatment of people suffering from it across the world. In this work, we develop and experiment with a novel model for estimating facial palsy severity. For this, an effective Facial Action Units (AU) detection technique is incorporated into our model, where AUs refer to a unique set of facial muscle movements used to describe almost every anatomically possible facial expression. In this paper, we propose a novel Adaptive Local-Global Relational Network (ALGRNet) for facial AU detection and use it to classify facial paralysis severity. ALGRNet mainly consists of three main novel structures: (i) an adaptive region learning module that learns the adaptive muscle regions based on the detected landmarks; (ii) a skip-BiLSTM that models the latent relationships among local AUs; and (iii) a feature fusion&refining module that investigates the complementary between the local and global face. Quantitative results on two AU benchmarks, i.e., BP4D and DISFA, demonstrate our ALGRNet can achieve promising AU detection accuracy. We further demonstrate the effectiveness of its application to facial paralysis estimation by migrating ALGRNet to a facial paralysis dataset collected and annotated by medical professionals.
研究动机与目标
- 为解决当前依赖主观临床评估、缺乏自动且客观的面部麻痹严重程度评估方法的问题。
- 通过建模动态且不规则的肌肉区域关系,而非固定网格或预定义的补丁区域,提升面部动作单元(AU)检测性能。
- 开发一种深度学习框架,将局部AU表征与全局面部上下文相结合,以增强特征互补性。
- 评估AU检测模型向临床面部瘫痪严重程度分类任务的可迁移性,该任务此前研究较少。
- 创建一个由医疗专业人员标注的临床相关面部瘫痪数据集(FPara),用于基准测试。
提出的方法
- ALGRNet采用自适应区域学习模块,基于检测到的面部关键点动态识别与AU相关的肌肉区域,替代固定网格或预定义补丁区域。
- 采用跳跃-BiLSTM网络建模局部AU特征之间的双向时序与关系依赖,实现AU分支之间的相互促进与抑制。
- 特征融合与精炼模块将局部AU特征与全局面部表征相结合,增强判别能力并适应不规则AU形状。
- 模型在公开AU基准数据集(BP4D和DISFA)上进行预训练,并在FPara数据集上微调,用于面部瘫痪严重程度评估。
- 网络架构采用端到端训练,结合多任务学习目标:AU检测与面部瘫痪分级。
- 通过可视化类激活图验证注意力定位与AU间关系,确认了空间与关系建模的改进。
实验结果
研究问题
- RQ1与固定网格或手工设计的补丁方法相比,自适应的关键点引导区域学习机制是否能提升AU检测准确率?
- RQ2AU关系的跳跃-BiLSTM建模在多大程度上能增强特征表征与分类性能?
- RQ3特征融合与精炼模块在结合局部与全局特征以应对不规则AU区域方面效果如何?
- RQ4最先进的AU检测模型能否有效迁移到具有高度临床相关性的面部瘫痪严重程度评估任务中?
- RQ5ALGRNet在新收集的、临床标注的面部瘫痪数据集上是否比现有方法具有更好的泛化能力?
主要发现
- ALGRNet在两个标准AU检测基准(BP4D和DISFA)上达到最先进性能,展现出卓越的AU检测准确率。
- 在FPara面部瘫痪数据集上,ALGRNet的平均F1得分为75.4%,比次优方法(J$̂$A-Net)高出2.6个百分点。
- ALGRNet的平均F1得分比基于Transformer的基线模型高出2.8%,证实其在建模面部动态以应对临床任务方面的有效性。
- 类激活图的可视化显示,ALGRNet能准确定位与AU相关的区域,并捕捉个体间AU的正相关与负相关关系。
- 该模型在不同个体和AU类别间均表现出良好泛化能力,尽管存在个体面部差异,仍保持一致且自适应的注意力图。
- 消融实验证实,自适应区域学习、跳跃-BiLSTM与融合与精炼模块均对最终性能提升有显著贡献。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。