Skip to main content
QUICK REVIEW

[论文解读] A Two-stage Multi-modal Affect Analysis Framework for Children with Autism Spectrum Disorder

Jicheng Li, Anjana Bhat|arXiv (Cornell University)|Jun 17, 2021
Autism Spectrum Disorder Research参考文献 27被引用 7
一句话总结

本文提出了一种两阶段多模态框架,结合语音与面部情绪识别,用于在游戏治疗过程中将自闭症谱系障碍(ASD)儿童分类为三种情感状态——积极、消极和中性。通过利用人类专业知识指导两阶段架构(首先基于语音线索检测消极状态,再通过面部表情区分积极与中性状态),该方法实现了72.40%的整体准确率,为ASD情感分析提供了人类洞察与机器学习相结合的创新范式。

ABSTRACT

Autism spectrum disorder (ASD) is a developmental disorder that influences the communication and social behavior of a person in a way that those in the spectrum have difficulty in perceiving other people's facial expressions, as well as presenting and communicating emotions and affect via their own faces and bodies. Some efforts have been made to predict and improve children with ASD's affect states in play therapy, a common method to improve children's social skills via play and games. However, many previous works only used pre-trained models on benchmark emotion datasets and failed to consider the distinction in emotion between typically developing children and children with autism. In this paper, we present an open-source two-stage multi-modal approach leveraging acoustic and visual cues to predict three main affect states of children with ASD's affect states (positive, negative, and neutral) in real-world play therapy scenarios, and achieved an overall accuracy of 72:40%. This work presents a novel way to combine human expertise and machine intelligence for ASD affect recognition by proposing a two-stage schema.

研究动机与目标

  • 解决缺乏专为ASD儿童设计的情感识别模型的问题,因为现有方法依赖通用情感数据集,未考虑ASD特有的情感表达模式。
  • 通过迁移学习与微调技术,应对真实游戏治疗数据中的领域偏移、数据噪声和标签稀疏性等挑战。
  • 开发一种框架,将临床洞察(如消极情感中的独特语音模式,以及积极与中性状态在面部表情上的差异)整合进机器学习流程中。
  • 提供一个可复现的、开源的ASD多模态情感分析基线,支持未来在自动化治疗评估与临床标注方面的研究。
  • 通过从视频记录中自动检测儿童情感状态,帮助物理治疗师更高效地评估治疗效果。

提出的方法

  • 采用两阶段分类架构:首先,基于语音线索(如喊叫、尖叫)使用语音情感识别(SER)判断儿童是否处于消极情感状态。
  • 在第二阶段,通过面部表情识别(FER)将非消极片段进一步分类为积极或中性情感状态。
  • 在预训练模型上应用迁移学习与微调,以适应包含真实世界、自然场景治疗录音的ASD情感数据集。
  • 对数据进行大量后处理与清洗,以应对ASD情感数据集中存在的噪声、低分辨率和标签不一致等问题,该数据集最初是为人类专家标注而非机器设计的。
  • 对每位参与者的预测结果进行归一化处理,以应对视频片段数量不均的问题,确保在数据集中多样化个体间的公平评估。
  • 使用混淆矩阵与F1分数评估所有三类情感状态的性能,并对每一阶段进行独立分析,以识别特定类别间的性能差距。

实验结果

研究问题

  • RQ1两阶段多模态框架能否在真实世界的游戏治疗中有效区分ASD儿童的积极、消极与中性情感状态?
  • RQ2将人类临床专业知识(特别是对消极情感中独特语音模式的识别,以及对积极与中性状态面部线索的区分)整合进机器学习模型,能在多大程度上提升ASD情感识别的性能?
  • RQ3在典型发育儿童与ASD儿童之间存在领域差异的情况下,预训练情感识别模型在ASD特定数据上的性能会受到多大程度的影响?
  • RQ4数据质量问题(如低分辨率、背景噪声、长时间未标注片段)会对真实治疗录音中情感识别的准确性造成何种影响?
  • RQ5能否开发一种半自动标注框架,支持临床医生对治疗视频进行标注,利用机器学习减少人工工作量,同时保持标注准确性?

主要发现

  • 在所有三类情感状态(积极、消极、中性)上的整体情感识别准确率达到72.40%,F1得分为0.75,证明了该两阶段框架在真实世界ASD治疗数据上的可行性。
  • 在第一阶段(消极 vs. 非消极),模型对少数类(消极)的召回率达到68.42%,表明其在通过语音线索检测消极情感方面表现中等。
  • 在第二阶段(积极 vs. 中性),模型对中性类的召回率达78.29%,对积极类的召回率为63.24%,F1得分为0.79,表明其在区分中性与积极状态方面表现更优。
  • 模型在不同参与者之间泛化良好,表现为每位参与者的归一化预测结果中,绿色与蓝色区域较大,表明分类结果一致且准确。
  • 在该数据集中,语音情感识别(SER)的表现优于面部情感识别(FER),可能是因为消极情感状态下的语音模式(如喊叫)更具辨识度。
  • 主导类与非主导类之间的性能差距凸显了在低分辨率与噪声条件下,识别积极与中性状态之间细微面部差异的挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。