Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Expectation of Label Distribution for Facial Age and Attractiveness Estimation

Bin-Bin Gao, Xinxin Liu|arXiv (Cornell University)|2020. 07. 03.
Face recognition and analysis참고 문헌 49인용 수 7
한 줄 요약

이 논문은 연령과 매력도 추정을 위한 경량이며 통합된 프레임워크인 DLDL-v2를 제안한다. 이는 레이블 분포를 동시에 학습하고 얼굴 속성 값의 회귀를 수행함으로써 훈련 목표와 평가 지표 간의 일관성 문제를 제거한다. 랭킹-CNN과 DLDL을 동일한 레이블 분포 학습 관점에서 통합하고 기대값 회귀 모듈을 도입함으로써, 기존 방법보다 36배 적은 파라미터와 3배 빠른 추론 속도로 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Facial attributes (\eg, age and attractiveness) estimation performance has been greatly improved by using convolutional neural networks. However, existing methods have an inconsistency between the training objectives and the evaluation metric, so they may be suboptimal. In addition, these methods always adopt image classification or face recognition models with a large amount of parameters, which carry expensive computation cost and storage overhead. In this paper, we firstly analyze the essential relationship between two state-of-the-art methods (Ranking-CNN and DLDL) and show that the Ranking method is in fact learning label distribution implicitly. This result thus firstly unifies two existing popular state-of-the-art methods into the DLDL framework. Second, in order to alleviate the inconsistency and reduce resource consumption, we design a lightweight network architecture and propose a unified framework which can jointly learn facial attribute distribution and regress attribute value. The effectiveness of our approach has been demonstrated on both facial age and attractiveness estimation tasks. Our method achieves new state-of-the-art results using the single model with 36$ imes$ fewer parameters and 3$ imes$ faster inference speed on facial age/attractiveness estimation. Moreover, our method can achieve comparable results as the state-of-the-art even though the number of parameters is further reduced to 0.9M (3.8MB disk storage).

연구 동기 및 목표

  • 얼굴 속성 추정에서 훈련 목표와 평가 지표(MAE) 간의 일관성 문제를 해결하기 위해.
  • 랭킹-CNN과 DLDL 방법을 동일한 레이블 분포 학습 프레임워크 아래 통합하기 위해.
  • 성능을 유지하거나 향상시키면서 모델 복잡도와 추론 비용을 줄이기 위해.
  • 연령과 매력도 추정을 위한 경량이며 효율적이고 해석 가능한 딥러닝 프레임워크를 개발하기 위해.
  • 파라미터 수를 줄이고 추론 속도를 높여 자원 제약이 있는 장치에의 배포를 가능하게 하기 위해.

제안 방법

  • 단일 네트워크를 사용해 레이블 분포를 동시에 학습하고 기대 속성 값을 회귀하는 통합된 DLDL-v2 프레임워크를 제안한다.
  • MAE를 직접 최적화하는 기대값 회귀 모듈을 도입하여 훈련과 평가 지표 간의 일致를 확보한다.
  • 오직 0.9M 파라미터를 가진 얇고 깊은 완전 컨volutional 아키텍처를 활용하여 저장 공간과 추론 비용을 감소시킨다.
  • 레이블 분포 학습을 통해 인접한 연령/매력도 레이블 간의 불확실성을 암묵적으로 모델링하여 강건성을 향상시킨다.
  • 특징 중요도 평가와 모델의 해석 가능성 확보를 위해 차폐 감도 분석을 포함한 데이터 증강 기법을 적용한다.
  • 랭킹-CNN과 DLDL을 통합하기 위해 둘 다 암묵적으로 레이블 분포를 학습한다는 점을 보여주며 공통 이론적 기반을 마련한다.

실험 결과

연구 질문

  • RQ1랭킹-CNN과 DLDL 방법은 동일한 레이블 분포 학습 프레임워크 아래 통합될 수 있는가?
  • RQ2레이블 분포 학습과 회귀를 동시에 수행하면 성능은 향상되고 모델 복잡도는 감소하는가?
  • RQ3경량 네트워크가 최소한의 파라미터와 빠른 추론으로 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ4모델의 결정 과정은 특정 얼굴 부위에 의존하는가? 그리고 그 해석 가능성은 있는가?
  • RQ5훈련-평가 일관성 문제를 제거하면 예측의 안정성과 정확도가 향상되는가?

주요 결과

  • DLDL-v2는 연령 및 매력도 추정 벤치마크에서 새로운 최신 기술 수준(SOTA) 성능을 달성한다.
  • 기존 SOTA 방법 대비 단일 모델을 사용해 파라미터 수를 36배 줄이고 추론 속도를 3배 빠르게 한다.
  • 오직 0.9M 파라미터(3.8MB 저장 공간)로도 최신 기술 수준 모델과 유사한 성능을 달성한다.
  • 차폐 분석 결과, 모델은 눈, 코, 입, 턱 등 연령과 매력도 추정에 핵심적인 얼굴 부위에 가장 크게 의존한다.
  • 레이블 분포와 기대값 회귀를 동시에 학습함으로써 성능이 더 안정적이고 이상치에 덜 민감해진다.
  • 프레임워크는 해석 가능하며, 특징 중요도 맵은 생물학적으로 관련 있는 얼굴 부위에 일관되게 주의를 기울인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.