Skip to main content
QUICK REVIEW

[论文解读] A Facial Affect Analysis System for Autism Spectrum Disorder

Beibin Li, Sachin Mehta|arXiv (Cornell University)|Apr 7, 2019
Autism Spectrum Disorder Research参考文献 24被引用 7
一句话总结

本文提出了一种端到端的机器学习系统,通过多任务卷积神经网络(CNN)在自然图像上进行训练,从视频中提取面部属性——表情、动作单元(AUs)、唤醒度和效价——用于自闭症谱系障碍(ASD)的分类。该系统实现了76%的F1分数,当结合所有面部属性时性能提升了7%,表明这些属性在统计学上显著且具有临床相关性,适用于ASD检测。

ABSTRACT

In this paper, we introduce an end-to-end machine learning-based system for classifying autism spectrum disorder (ASD) using facial attributes such as expressions, action units, arousal, and valence. Our system classifies ASD using representations of different facial attributes from convolutional neural networks, which are trained on images in the wild. Our experimental results show that different facial attributes used in our system are statistically significant and improve sensitivity, specificity, and F1 score of ASD classification by a large margin. In particular, the addition of different facial attributes improves the performance of ASD classification by about 7% which achieves a F1 score of 76%.

研究动机与目标

  • 开发一种基于真实世界视频数据中面部属性的端到端机器学习系统,用于ASD分类。
  • 研究不同面部属性(表情、AUs、唤醒度和效价)对ASD分类性能的贡献。
  • 评估在ASD检测背景下,多任务学习与单任务学习在面部属性识别中的有效性。
  • 证明面部属性是提高ASD分类敏感性、特异性和F1分数的统计显著指标。
  • 在缺乏大规模ASD特异性面部数据集的情况下,建立一种基于大规模自然图像数据集学习表示的ASD检测框架。

提出的方法

  • 在两个大规模自然图像数据集(AffectNet和EmotioNet)上训练一个多任务CNN,同时预测四种面部属性:面部表情、动作单元(AUs)、唤醒度和效价。
  • 网络采用标准CNN架构,包含卷积层和池化层,通过结合任务特定损失和L2正则化的多任务损失函数进行优化。
  • 对于每一帧视频,将四种属性的特征向量拼接成一个k维向量,其中AUs和表情以概率分数表示,唤醒度和效价以[-1, 1]范围内的标量值表示。
  • 通过统计度量(均值、标准差、激活时间及正向率)在帧间应用时间特征提取,将9,575帧的序列压缩为每个参与者58维的特征向量。
  • 由于数据量有限,使用留一法交叉验证,在58维特征上训练多种二分类器(逻辑回归、LASSO、LDA、QDA、SVM、XGBoost和一个两层神经网络)。
  • 通过在不同属性组合下的分类性能进行学生t检验,评估每个面部属性的统计显著性。

实验结果

研究问题

  • RQ1与仅使用部分属性相比,整合多种面部属性(表情、AUs、唤醒度、效价)是否能提升ASD分类性能?
  • RQ2不同面部属性对分类性能的个体贡献如何?哪些属性具有统计显著性?
  • RQ3在ASD检测背景下,多任务学习是否比单任务学习在面部属性识别方面更有效?
  • RQ4尽管缺乏大规模ASD标注的面部数据集,从自然图像中学习的表征是否能很好地泛化到ASD分类?
  • RQ5何种面部属性的最佳组合能够最大化ASD分类中的F1分数、敏感性和特异性?

主要发现

  • 与仅使用部分属性相比,包含全部四种面部属性(面部表情、AUs、唤醒度和效价)使F1分数提高了7%,最终达到76%的F1分数。
  • 使用瓶颈层作为基础特征提取器时,系统实现了最高的分类性能,敏感性为76%,特异性为69%。
  • 统计分析(学生t检验)确认唤醒度(p = 0.007)、效价(p = 0.001)和面部表情(p = 0.006)是提升分类性能的最重要贡献因素。
  • 多任务学习方法在面部属性识别中优于单任务学习,表明多个属性的联合学习可提升特征表示质量。
  • 使用均值、标准差、激活时间及正向率的时间特征提取方法,能有效捕捉视频序列中的动态面部模式,在此小数据集上优于RNN和时间卷积网络。
  • 该系统表明,从自然图像中通过深度学习提取的面部属性可作为ASD分类的稳健且具有统计显著性的指标,即使未在ASD标注数据上进行直接训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。