[论文解读] Joint Estimation of Age and Gender from Unconstrained Face Images using Lightweight Multi-task CNN for Mobile Applications
本文提出一种轻量级多任务卷积神经网络(LMTCNN),用于从非约束条件下的人脸图像中联合进行年龄和性别估计,通过使用深度可分离卷积和硬参数共享来减少模型大小和推理时间。该方法在模型大小减少高达9倍、移动端推理时间减少超过95%的同时,实现了与最先进模型相当的准确率。
Automatic age and gender classification based on unconstrained images has become essential techniques on mobile devices. With limited computing power, how to develop a robust system becomes a challenging task. In this paper, we present an efficient convolutional neural network (CNN) called lightweight multi-task CNN for simultaneous age and gender classification. Lightweight multi-task CNN uses depthwise separable convolution to reduce the model size and save the inference time. On the public challenging Adience dataset, the accuracy of age and gender classification is better than baseline multi-task CNN methods.
研究动机与目标
- 为计算资源有限的移动端设备开发一个紧凑的深度学习模型,实现实时年龄与性别估计。
- 解决在移动应用中常见的非约束、真实世界环境下部署高精度年龄与性别分类系统所面临的挑战。
- 通过结合多任务学习与高效卷积操作,在不牺牲分类准确率的前提下,减少模型大小和推理延迟。
- 通过单一共享特征提取器实现年龄与性别的同时推理,最大限度减少内存与计算开销。
- 证明该模型在低端移动硬件(如智能手机和智能机器人)上部署的可行性。
提出的方法
- 在多任务学习框架中采用硬参数共享范式,即一个单一共享的CNN主干网络同时为年龄和性别分类提取特征。
- 将基线模型中的标准卷积替换为深度可分离卷积,以显著降低计算成本和模型大小。
- 使用深度可分离卷积,将其分解为逐通道卷积(每个输入通道使用1×1卷积核)和逐点卷积(使用1×1卷积核进行特征融合)两个操作。
- 应用宽度乘数和分辨率乘数,进一步控制模型复杂度,并在速度与准确率之间实现权衡。
- 通过在最先进模型Levi_Hassner CNN [8]的基础上进行修改,集成深度可分离卷积和多任务学习,构建LMTCNN架构。
- 将训练好的模型转换为TensorFlow计算图,以便在基于Android的移动设备上进行部署。
实验结果
研究问题
- RQ1轻量级多任务CNN是否能在适合移动端部署的同时,实现与更大模型相当的年龄与性别分类准确率?
- RQ2在非约束人脸图像上,深度可分离卷积在不降低性能的前提下,能在多大程度上减少模型大小和推理时间?
- RQ3在移动端环境中,年龄与性别任务之间的硬参数共享如何影响模型效率与泛化能力?
- RQ4与现有方法相比,所提模型在低端移动硬件上的实际推理速度与内存占用情况如何?
- RQ5该模型在具有挑战性的野外数据集Adience上是否能保持高准确率,同时又针对移动端推理进行了优化?
主要发现
- 当第一个深度可分离卷积的宽度乘数为2、第二个为1时,LMTCNN在年龄估计上的top-1准确率达到44.26%,性别分类准确率为85.16%,在性别分类准确率上优于基线Levi_Hassner CNN,且模型显著更小。
- 当宽度乘数为1时,LMTCNN的模型大小仅为8.7 MB,相比Levi_Hassner CNN的70.8 MB减少了9倍。
- 在ASUS Zenbo设备上,LMTCNN-1-1的推理速度为204.7 ms/帧,LMTCNN-2-1为297.6 ms/帧,而Levi_Hassner CNN约为4800 ms/帧,实现了超过95%的加速。
- 当宽度乘数设为2时,LMTCNN在年龄估计上达到70.78%的top-2准确率,性别分类准确率为85.16%,模型大小仅为30 MB。
- 该系统已成功部署于ASUS Zenbo机器人和ASUS Zenfone 3智能手机等移动设备上,展示了实时性能与低内存占用。
- 使用深度可分离卷积使计算成本降低了$ \frac{D_K^2 C_O}{D_K^2 + C_O} $倍,且对于通道数更高的模型,加速效果更显著。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。