Skip to main content
QUICK REVIEW

[논문 리뷰] Joint Estimation of Age and Gender from Unconstrained Face Images using Lightweight Multi-task CNN for Mobile Applications

Jia‐Hong Lee, Yi-Ming Chan|arXiv (Cornell University)|2018. 06. 06.
Face recognition and analysis참고 문헌 15인용 수 3
한 줄 요약

이 논문은 깊이 분리형 합성곱과 하드 파rameter 공유를 활용하여 모델 크기와 추론 시간을 줄이는 경량 다중 작업 CNN(LMTCNN)을 제안한다. 이는 제약 조건이 없는 얼굴 이미지에서 연령과 성별을 동시에 추정하는 데에 사용된다. 제안된 방법은 최신 기술 수준의 모델과 비슷한 정확도를 달성하면서도 모델 크기를 최대 9배 줄이고, 모바일 기기에서 추론 시간을 95% 이상 단축시킨다.

ABSTRACT

Automatic age and gender classification based on unconstrained images has become essential techniques on mobile devices. With limited computing power, how to develop a robust system becomes a challenging task. In this paper, we present an efficient convolutional neural network (CNN) called lightweight multi-task CNN for simultaneous age and gender classification. Lightweight multi-task CNN uses depthwise separable convolution to reduce the model size and save the inference time. On the public challenging Adience dataset, the accuracy of age and gender classification is better than baseline multi-task CNN methods.

연구 동기 및 목표

  • 제한된 계산 자원을 가진 모바일 기기에서 실시간으로 연령과 성별 추정을 수행할 수 있는 컴act한 딥러닝 모델을 개발한다.
  • 모바일 애플리케이션에서 흔히 발생하는 제약 조건이 없는 실제 환경에서 정확한 연령 및 성별 분류 시스템을 구현하는 데 도전한다.
  • 다중 작업 학습과 효율적인 합성곱 연산을 조합하여 분류 정확도를 유지하면서도 모델 크기와 추론 지연 시간을 줄인다.
  • 단일 공유 특징 추출기로 연령과 성별에 대한 동시에 추론을 가능하게 하여 메모리 및 계산 오버헤드를 최소화한다.
  • 스마트폰과 스마트 로봇과 같은 저성능 모바일 하드웨어에 모델을 배포할 수 있음을 입증한다.

제안 방법

  • 연령과 성별 분류를 위한 특징 추출을 동시에 수행하는 단일 공유 CNN 기반을 갖춘 다중 작업 학습 프레임워크에서 하드 파arameter 공유 기반의 방식을 적용한다.
  • 기본 모델의 표준 합성곱 연산을 깊이 분리형 합성곱으로 대체하여 계산 비용과 모델 크기를 크게 줄인다.
  • 깊이 분리형 합성곱은 표준 합성곱을 입력 채널 수만큼의 1x1 커널을 사용하는 깊이 합성곱과 특징 조합을 위한 1x1 커널을 사용하는 포인트와이즈 합성곱으로 분해한다.
  • 모델 복잡도를 추가로 제어하고 속도와 정확도 사이의 트레이드오프를 조정하기 위해 너비 배수와 해상도 배수를 적용한다.
  • 최신 기술 수준의 Levi_Hassner CNN [8]을 수정하여 깊이 분리형 합성곱과 다중 작업 학습을 통합한 LMTCNN 아키텍처를 구성한다.
  • Android 기반 모바일 기기에서의 배포를 위해 훈련된 모델을 텐서플로우 계산 그래프로 변환한다.

실험 결과

연구 질문

  • RQ1경량 다중 작업 CNN이 더 큰 모델과 비슷한 연령 및 성별 분류 정확도를 달성하면서도 모바일 배포에 적합한가?
  • RQ2깊이 분리형 합성곱이 제약 조건이 없는 얼굴 이미지에서 성능 저하 없이 모델 크기와 추론 시간을 얼마나 줄일 수 있는가?
  • RQ3모바일 환경에서 연령과 성별 작업 간 하드 파arameter 공유가 모델의 효율성과 일반화 능력에 어떤 영향을 미치는가?
  • RQ4기존 방법과 비교해 볼 때 제안된 모델이 저성능 모바일 하드웨어에서 실제 환경에서의 추론 속도와 메모리 사용량은 어떠한가?
  • RQ5최적화된 모바일 추론을 위해 설계된 모델이 도전적인 실외 환경에서의 Adience 벤치마크에서 높은 정확도를 유지할 수 있는가?

주요 결과

  • 첫 번째 깊이 분리형 합성곱에 너비 배수 2, 두 번째에 너비 배수 1을 적용한 LMTCNN는 연령 추정에서 44.26%의 top-1 정확도, 성별 분류에서 85.16%의 정확도를 기록했으며, 기준 모델인 Levi_Hassner CNN보다 성별 정확도가 높고 모델 크기가 훨씬 작았다.
  • 너비 배수 1을 사용한 LMTCNN의 모델 크기는 오직 8.7 MB였으며, Levi_Hassner CNN의 70.8 MB 대비 9배 감소한 것이다.
  • ASUS Zenbo에서의 추론 속도는 LMTCNN-1-1이 204.7 ms/프레임, LMTCNN-2-1이 297.6 ms/프레임이었고, Levi_Hassner CNN의 약 4800 ms/프레임에 비해 95% 이상의 속도 향상을 달성했다.
  • 너비 배수를 2로 설정했을 때, LMTCNN는 연령 추정에서 70.78%의 top-2 정확도, 성별 분류에서 85.16%의 정확도를 기록했으며, 모델 크기는 오직 30 MB였다.
  • 시스템은 ASUS Zenbo 로봇과 ASUS Zenfone 3 스마트폰을 포함한 다양한 모바일 기기에서 성공적으로 배포되어 실시간 성능과 낮은 메모리 사용량을 입증했다.
  • 깊이 분리형 합성곱의 사용으로 계산 비용이 $ \frac{D_K^2 C_O}{D_K^2 + C_O} $ 배 감소했으며, 채널 수가 높을수록 더 큰 속도 향상 효과를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.