[论文解读] CNN-based Facial Affect Analysis on Mobile Devices
本文提出三种专为移动设备部署优化的轻量化CNN架构,旨在实现在智能手机上实时进行面部情感分析。在AffectNet数据集上的评估显示,模型在八分类情绪识别中达到58%的准确率,在唤醒度/情绪强度预测中平均RMSE为0.39,且在iPhone 6S上实现约45 fps的实时推理速度,证明了其在情感驱动音乐推荐等实际应用中的可行性。
This paper focuses on the design, deployment and evaluation of Convolutional Neural Network (CNN) architectures for facial affect analysis on mobile devices. Unlike traditional CNN approaches, models deployed to mobile devices must minimise storage requirements while retaining high performance. We therefore propose three variants of established CNN architectures and comparatively evaluate them on a large, in-the-wild benchmark dataset of facial images. Our results show that the proposed architectures retain similar performance to the dataset baseline while minimising storage requirements: achieving 58% accuracy for eight-class emotion classification and average RMSE of 0.39 for valence/arousal prediction. To demonstrate the feasibility of deploying these models for real-world applications, we implement a music recommendation interface based on predicted user affect. Although the CNN models were not trained in the context of music recommendation, our case study shows that: (i) the trained models achieve similar prediction performance to the benchmark dataset, and (ii) users tend to positively rate the song recommendations provided by the interface. Average runtime of the deployed models on an iPhone 6S equates to ~45 fps, suggesting that the proposed architectures are also well suited for real-time deployment on video streams.
研究动机与目标
- 设计并部署针对存储和计算资源有限的移动设备量身定制的高效CNN架构,用于面部情感分析。
- 在大规模、真实场景下的数据集(AffectNet)上评估这些模型,以确保其性能可与最先进基准相当。
- 通过将模型集成到音乐推荐应用中作为概念验证,展示其在真实世界中的可部署性,以实现情感智能用户界面(EIUIs)。
- 通过一项关于基于情感的歌曲推荐的用户研究,评估用户感知与系统在真实场景下的表现。
- 探索在移动应用中实现设备端情感识别的可行性,同时最大限度减少数据留存并强化隐私保护。
提出的方法
- 提出三种基于成熟CNN架构(VGGNet)的变体,通过结构优化减少模型大小,同时保持性能。
- 在AffectNet数据集上训练模型,该数据集包含450,000张真实场景下的面部图像,标注了八种离散情绪、唤醒度和情绪强度。
- 应用数据增强和迁移学习技术,以提升模型泛化能力并减少在移动优化模型上的过拟合。
- 使用Apple的CoreML框架将训练好的模型部署在iPhone 6S上,实现低延迟的设备端推理。
- 实现一个音乐推荐界面,通过启发式映射策略将预测出的情感(情绪、唤醒度、情绪强度)转化为歌曲推荐。
- 通过用户研究评估推荐质量感知与用户隐私顾虑,所有数据均在设备本地处理。
实验结果
研究问题
- RQ1轻量化CNN架构是否能在最小化移动设备存储需求的同时,实现与最先进模型相当的面部情感识别性能?
- RQ2这些模型在消费级移动硬件(如iPhone 6S)上的推理速度与实时性能表现如何?
- RQ3在真实场景中,基于预测面部情感的个性化音乐推荐在多大程度上能被用户积极感知?
- RQ4用户在使用分析面部情感的移动应用时,其隐私顾虑为何?这些顾虑在采用设备端处理时能否有效缓解?
- RQ5在通用情感数据集上训练的模型,是否可在无需微调的情况下,有效应用于特定任务(如音乐推荐)?
主要发现
- 所提出的CNN变体在AffectNet数据集上实现了八分类情绪识别58%的准确率,以及唤醒度/情绪强度预测0.39的平均RMSE,与数据集基线模型性能相当。
- 部署后的模型在iPhone 6S上运行速度约为45 fps,证实其适用于实时视频流处理。
- 用户研究结果显示,参与者对歌曲推荐的平均评分为5分制中的3.2分,当情绪分类正确时评分更高(达3.9分)。
- 用户对应用功能总体表示满意,但强调更倾向于本地数据处理,且不希望面部图像被持久存储。
- 研究证实,基于通用数据集训练的情感模型可有效应用于特定应用场景(如音乐推荐),即使未进行任务特定的微调。
- 隐私顾虑确实存在,但较预期轻微,尤其在数据处理全程保留在设备端且未存储图像的情况下。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。