Skip to main content
QUICK REVIEW

[논문 리뷰] C3AE: Exploring the Limits of Compact Model for Age Estimation

Chao Zhang, Shuaicheng Liu|arXiv (Cornell University)|2019. 04. 10.
Face recognition and analysis참고 문헌 39인용 수 11
한 줄 요약

C3AE는 표준 합성곱을 사용하여 깊이 분리형 합성곱 대신 매우 컴팩트한 연령 추정 모델을 제안하며, 오직 39.7K 파라미터(0.25MB)로도 최신 기술 수준의 성능을 달성한다. 이는 계단식 모델과 다중 스케일 컨텍스트 집약을 통해 이중점 분포 표현 방식을 활용하며, Morph-II(2.75 MAE)와 FG-NET(2.95 MAE)에서 이전의 컴팩트 모델을 능가한다. 또한 VGGNet의 1/2000 크기이다.

ABSTRACT

Age estimation is a classic learning problem in computer vision. Many larger and deeper CNNs have been proposed with promising performance, such as AlexNet, VggNet, GoogLeNet and ResNet. However, these models are not practical for the embedded/mobile devices. Recently, MobileNets and ShuffleNets have been proposed to reduce the number of parameters, yielding lightweight models. However, their representation has been weakened because of the adoption of depth-wise separable convolution. In this work, we investigate the limits of compact model for small-scale image and propose an extremely Compact yet efficient Cascade Context-based Age Estimation model(C3AE). This model possesses only 1/9 and 1/2000 parameters compared with MobileNets/ShuffleNets and VggNet, while achieves competitive performance. In particular, we re-define age estimation problem by two-points representation, which is implemented by a cascade model. Moreover, to fully utilize the facial context information, multi-branch CNN network is proposed to aggregate multi-scale context. Experiments are carried out on three age estimation datasets. The state-of-the-art performance on compact model has been achieved with a relatively large margin.

연구 동기 및 목표

  • 작은 규모의 얼굴 이미지에서 연령 추정을 위한 컴팩트한 딥 러닝 모델의 한계를 탐구한다.
  • 작은/중간 규모의 이미지에 대한 경량 모델에서 깊이 분리형 합성곱의 지배적 위치를 도전한다.
  • 연령 추정 문제를 이중점 분포 문제로 재정의함으로써 컴팩트 모델의 성능을 향상시킨다.
  • 다지점 CNN을 사용한 다중 스케일 컨텍스트 집약을 통해 특징 표현을 향상시킨다.
  • 최소한의 모델 크기와 메모리 점유율로도 컴팩트한 연령 추정에서 최신 기술 수준의 성능를 달성한다.

제안 방법

  • 깊이 분리형 합성곱보다 작은 규모의 이미지에서 효과가 떨어지므로, 표준 합성곱 레이어를 사용하는 컴팩트한 모델을 제안한다.
  • 연령을 두 개의 이산적 연령 수준에 대한 분포로 모델링하여 분류와 회귀를 통합하는 이중점 분포 표현 방식을 도입한다.
  • 순차적인 회귀 단계를 통해 예측을 정밀하게 다듬는 계단식 모델 아키텍처를 활용한다.
  • 다중 분지 CNN을 설계하여 얼굴의 다중 스케일 컨텍스트 특징을 추출하고 집약함으로써 표현력을 향상시킨다.
  • 분포 일치 손실을 최소화하기 위해 의미적 분포를 갖춘 완전 연결층을 사용하여 특징를 연령 값으로 매핑한다.
  • 예측된 연령 분포와 진짜 연령 분포를 일치시키기 위해 분포 일치 목표를 사용하여 모델을 종합적으로 훈련한다.

실험 결과

연구 질문

  • RQ1깊이 분리형 합성곱은 작은 규모의 얼굴 이미지에서 컴팩트한 연령 추정에 최적화되어 있는가?
  • RQ2더 적은 파라미터를 가진 표준 합성곱을 사용하는 컴팩트 모델이 MobileNet과 ShuffleNet을 능가할 수 있는가?
  • RQ3이중점 분포 표현 방식은 분류, 회귀, 레이블 분포 정보를 통합하는 데 얼마나 효과적인가?
  • RQ4다중 스케일 컨텍스트 집약은 컴팩트 모델의 성능 향상에 상당한 기여를 할 수 있는가?
  • RQ5ImageNet 또는 IMDB-Wiki 사전 훈련 없이도 초소형 모델이 경쟁 가능한 성능를 달성할 수 있는가?

주요 결과

  • IMDB-WIKI에 대해 미세조정한 C3AE는 Morph-II에서 2.75 MAE를 기록하여 이전 최고 성능의 컴팩트 모델(SR at 3.16 MAE)을 능가한다.
  • 전체 C3AE 모델은 사전 훈련 없이도 Morph-II에서 2.78 MAE를 기록하여 사전 훈련 없이도 뛰어난 성능를 보여준다.
  • FG-NET에서는 사전 훈련 시 2.95 MAE, 사전 훈련 없이도 4.09 MAE를 기록하며, 후자의 경우 MV(4.10 MAE)를 능가한다.
  • 모델은 오직 39.7K 파라미터와 0.25MB 메모리만을 사용하여 VGGNet의 1/2000 크기이면서도 경쟁 가능한 정확도를 유지한다.
  • 순수한 C3AE 모델(39.7K 파라미터)은 사전 훈련 없이도 Morph-II에서 3.13 MAE를 기록하여 매우 단순한 아키텍처로도 강력한 일반화 성능를 보여준다.
  • 제거 실험 결과 표준 합성곱이 작은 규모의 이미지에서 깊이 분리형 합성곱보다 우수한 성능를 보이며, MobileNet과 ShuffleNet의 가정을 도전한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.