[论文解读] Deep Learning Models for Automated Classification of Dog Emotional States from Facial Expressions
本研究提出了一种深度学习框架,用于从受控实验数据集中自动分类狗的情绪状态——具体为积极期待和挫败感——基于面部表情。通过自监督预训练,DINO-ViT在性能上优于ResNet及其他主干网络,表现出更高的准确率,并在与情绪表达相关的面部关键区域实现更精准的注意力聚焦。
Similarly to humans, facial expressions in animals are closely linked with emotional states. However, in contrast to the human domain, automated recognition of emotional states from facial expressions in animals is underexplored, mainly due to difficulties in data collection and establishment of ground truth concerning emotional states of non-verbal users. We apply recent deep learning techniques to classify (positive) anticipation and (negative) frustration of dogs on a dataset collected in a controlled experimental setting. We explore the suitability of different backbones (e.g. ResNet, ViT) under different supervisions to this task, and find that features of a self-supervised pretrained ViT (DINO-ViT) are superior to the other alternatives. To the best of our knowledge, this work is the first to address the task of automatic classification of canine emotions on data acquired in a controlled experiment.
研究动机与目标
- 开发一种用于从面部表情自动分类犬类情绪状态的深度学习系统,重点关注积极期待和挫败感。
- 评估不同深度学习主干网络(ResNet与视觉Transformer(ViT))在犬类情绪识别任务中的性能表现。
- 比较监督预训练与自监督预训练策略(如ImageNet与DINO)在提升模型泛化能力与性能方面的效果。
- 利用激活图评估模型可解释性,并将学习到的特征与行为科学概念(如DogFACS动作单元)关联。
- 基于严谨收集的受控数据集,建立犬类情感计算的可靠、客观基线。
提出的方法
- 使用拉布拉多寻回猎犬的受控实验数据集,通过诱发积极期待和挫败感,确保真实标签的一致性与可靠性。
- 采用不同主干网络(ResNet与视觉Transformer(ViT))训练多个深度学习模型,结合监督预训练(ImageNet)与自监督预训练(DINO)。
- 应用Eigen-CAM技术可视化激活图,以解释模型注意力机制,并评估其在眼睛、耳朵、鼻子等面部区域的定位能力。
- 在平衡测试集上使用标准分类指标(如准确率、F1值)评估模型性能。
- 利用DINO-ViT的自监督预训练提取对物体部分敏感的语义丰富特征,从而提升对细微面部动作的识别能力。
- 将模型注意力与DogFACS动作单元进行映射,以验证其与行为科学概念的一致性。
实验结果
研究问题
- RQ1深度学习模型能否准确地基于受控行为实验中的面部表情,分类犬类情绪状态——特别是积极期待与挫败感?
- RQ2在该任务中,不同主干网络架构(ResNet与ViT)在犬类情绪识别方面的性能表现如何比较?
- RQ3对于低资源、高可变性的动物情绪识别任务,自监督预训练(DINO)是否优于监督预训练(ImageNet)?
- RQ4模型激活图在多大程度上能准确定位到生物学相关的面部区域?这与DogFACS中的已知动作单元有何关联?
- RQ5像Eigen-CAM这样的可解释性技术能否提供对模型预测与失败原因的可解释洞察,从而支持科学验证?
主要发现
- DINO-ViT在所有测试主干网络中取得了最高的分类准确率,优于ResNet与ImageNet预训练的ViT。
- 与监督预训练(ImageNet)相比,使用DINO进行自监督预训练显著提升了模型性能,尤其在捕捉细微面部线索方面表现更优。
- 基于ViT的模型在显著面部区域(如眼睛、耳朵、鼻子)上表现出更优的注意力定位能力,而ResNet则显示出更广泛且不集中的激活模式。
- Eigen-CAM可视化结果表明,DINO-ViT能同时激活多个关键面部区域,与人工标注的DogFACS动作单元高度一致。
- DINO-ViT模型在行为相关特征上保持了稳定的注意力,表明其特征对物体部分及与情绪相关的面部运动具有敏感性。
- 通过Eigen-CAM,即使在预测错误时,模型预测也具有可解释性,因其具有类别无关性,从而可分析失败模式与特征相关性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。