[论文解读] Automated Detection of Equine Facial Action Units
本文提出了一种基于深度学习的级联框架,用于使用基于区域的对象检测和二分类方法,自动检测马匹面部动作单元(AUs)。在眼部和下颌面部区域的九个AUs上取得了令人满意的结果,当使用预定义的感兴趣区域(ROIs)时,模型的注意力和准确性均得到提升,证明了自动化劳动密集型的EquiFACS标注的可行性。
The recently developed Equine Facial Action Coding System (EquiFACS) provides a precise and exhaustive, but laborious, manual labelling method of facial action units of the horse. To automate parts of this process, we propose a Deep Learning-based method to detect EquiFACS units automatically from images. We use a cascade framework; we firstly train several object detectors to detect the predefined Region-of-Interest (ROI), and secondly apply binary classifiers for each action unit in related regions. We experiment with both regular CNNs and a more tailored model transferred from human facial action unit recognition. Promising initial results are presented for nine action units in the eye and lower face regions. Code for the project is publicly available.
研究动机与目标
- 自动化基于马匹面部编码系统(EquiFACS)定义的马匹面部动作单元(AUs)的手动标注过程。
- 研究在存在解剖学差异的情况下,是否可以将人类AU识别的深度学习模型迁移到马匹上。
- 评估感兴趣区域(ROI)裁剪和目标检测在提升AU分类准确性方面的有效性。
- 评估基于静态图像的AU检测的局限性,特别是对于眨眼等时间敏感动作。
- 探索将该框架扩展至视频以检测动态AUs(如眨眼和耳朵运动)的潜力。
提出的方法
- 两阶段级联框架:首先,目标检测器在马匹面部中识别预定义的感兴趣区域(ROIs)(例如,眼部区域、下颌面部)。
- 其次,对裁剪后的ROIs应用二分类器以检测单个AUs,使用标准卷积神经网络(CNNs)(如AlexNet)以及从人类AU识别微调得到的模型。
- 该框架采用从预训练的人类面部AU识别模型进行迁移学习,以提升在马匹数据上的性能。
- 使用Grad-CAM可视化分析并验证模型注意力,确保分类器聚焦于相关面部子区域。
- 在小规模、不平衡的数据集上使用5折交叉验证评估性能,指标包括准确率和F1值。
- 比较在完整图像上端到端训练与在裁剪ROIs上训练的差异,以评估空间监督的影响。
实验结果
研究问题
- RQ1尽管存在解剖学差异,基于人类面部AU识别训练的深度学习模型是否能有效迁移到马匹面部AUs检测?
- RQ2预定义感兴趣区域(ROIs)是否能显著提升马匹AU分类器的性能和注意力稳定性?
- RQ3标准CNNs与迁移学习模型在静态图像上检测马匹AUs方面表现如何比较?
- RQ4基于静态图像的AU检测在时间敏感动作(如眨眼,AU47、AU145)方面存在哪些局限性?
- RQ5该框架是否可扩展至检测耳部动作描述符(EADs)或从视频序列中检测动态面部表情?
主要发现
- 该框架在八个AUs(排除AU101)上表现稳定,准确率在49.6%至65.2%之间,F1值在47.9%至64.0%之间。
- 对于AU101(内侧皱眉),使用DRML模型实现了65.2%的准确率和64.0%的F1值,Grad-CAM可视化证实当使用ROIs时,模型注意力集中在正确的内侧皱眉区域。
- DRML模型在不同受试者折中表现更稳定,尤其在AU145(眨眼)和AU47(半次眨眼)上,这两者在视觉上相似。
- 模型在AU47上表现不佳,是由于静态图像中视觉差异细微,表明需要通过视频进行时间建模才能实现可靠检测。
- 在静态图像中,该框架无法区分AU145(眨眼)和AU143(眼睑闭合),因为两者视觉状态相同,尽管AU143因样本量过低被排除。
- Grad-CAM可视化证实,基于裁剪ROIs训练的模型聚焦于相关面部子区域(如眼睑、鼻孔、嘴角),而基于完整图像训练的模型未能关注关键区域。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。