Skip to main content
QUICK REVIEW

[论文解读] C3AE: Exploring the Limits of Compact Model for Age Estimation

Chao Zhang, Shuaicheng Liu|arXiv (Cornell University)|Apr 10, 2019
Face recognition and analysis参考文献 39被引用 11
一句话总结

C3AE 提出了一种使用标准卷积而非深度可分离卷积的极简年龄估计模型,在仅 39.7K 参数(0.25MB)的情况下,实现了紧凑模型的最先进性能。该模型通过级联模型实现两阶段分布表示,并结合多尺度上下文聚合,在 Morph-II(2.75 MAE)和 FG-NET(2.95 MAE)上均优于以往的紧凑模型,且模型大小仅为 VGGNet 的 1/2000。

ABSTRACT

Age estimation is a classic learning problem in computer vision. Many larger and deeper CNNs have been proposed with promising performance, such as AlexNet, VggNet, GoogLeNet and ResNet. However, these models are not practical for the embedded/mobile devices. Recently, MobileNets and ShuffleNets have been proposed to reduce the number of parameters, yielding lightweight models. However, their representation has been weakened because of the adoption of depth-wise separable convolution. In this work, we investigate the limits of compact model for small-scale image and propose an extremely Compact yet efficient Cascade Context-based Age Estimation model(C3AE). This model possesses only 1/9 and 1/2000 parameters compared with MobileNets/ShuffleNets and VggNet, while achieves competitive performance. In particular, we re-define age estimation problem by two-points representation, which is implemented by a cascade model. Moreover, to fully utilize the facial context information, multi-branch CNN network is proposed to aggregate multi-scale context. Experiments are carried out on three age estimation datasets. The state-of-the-art performance on compact model has been achieved with a relatively large margin.

研究动机与目标

  • 探索在小规模面部图像上,紧凑深度学习模型在年龄估计任务中的极限。
  • 挑战深度可分离卷积在小/中等规模图像轻量化模型中的主导地位。
  • 通过将年龄估计重新定义为两阶段分布问题,提升紧凑模型的性能。
  • 通过多分支卷积神经网络实现多尺度上下文聚合,增强特征表示能力。
  • 在极小模型尺寸和内存占用下,实现紧凑年龄估计的最先进性能。

提出的方法

  • 提出一种使用标准卷积层而非深度可分离卷积的紧凑模型,后者在小规模图像上表现较差。
  • 引入两阶段年龄分布表示方法,将年龄建模为两个离散年龄级别的分布,以结合分类与回归任务。
  • 采用级联模型架构,通过多步回归逐步优化预测结果。
  • 设计多分支卷积神经网络,提取并聚合多尺度面部上下文特征,以增强表示能力。
  • 使用全连接层结合语义分布,将特征映射到年龄值,并最小化分布匹配损失。
  • 端到端训练模型,采用分布匹配目标,使预测年龄分布与真实年龄分布对齐。

实验结果

研究问题

  • RQ1深度可分离卷积是否适用于小规模面部图像上的紧凑年龄估计?
  • RQ2尽管参数更少,使用标准卷积的紧凑模型是否能在年龄估计中超越 MobileNet 和 ShuffleNet?
  • RQ3两阶段分布表示在结合分类、回归与标签分布信息方面,对年龄估计的有效性如何?
  • RQ4多尺度上下文聚合是否能显著提升紧凑模型的性能?
  • RQ5在未使用 ImageNet 或 IMDB-Wiki 预训练的情况下,极小模型是否仍能实现有竞争力的性能?

主要发现

  • 在 IMDB-WIKI 上微调后,C3AE 在 Morph-II 上实现 2.75 MAE,优于此前最佳紧凑模型 SSR(3.16 MAE)。
  • 完整版 C3AE 模型在从零开始训练时,于 Morph-II 上实现 2.78 MAE,表明其在无预训练情况下仍具备强大性能。
  • 在 FG-NET 上,C3AE 在预训练下实现 2.95 MAE,在无预训练下实现 4.09 MAE,后者优于 MV 模型(4.10 MAE)。
  • 该模型仅使用 39.7K 参数和 0.25MB 内存,模型大小仅为 VGGNet 的 1/2000,同时保持了有竞争力的准确率。
  • 普通 C3AE 模型(39.7K 参数)在无预训练情况下于 Morph-II 上实现 3.13 MAE,展现出极简架构下的强大泛化能力。
  • 消融实验表明,标准卷积在小规模图像上优于深度可分离卷积,挑战了 MobileNet 和 ShuffleNet 中的既有假设。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。