Skip to main content
QUICK REVIEW

[논문 리뷰] Age Group and Gender Estimation in the Wild with Deep RoR Architecture

Ke Zhang, Ce Gao|arXiv (Cornell University)|2017. 10. 09.
Face recognition and analysis참고 문헌 42인용 수 13
한 줄 요약

이 논문은 제안된 깊이 있는 Residual Networks of Residual Networks (RoR) 아키텍처를 통해 제한되지 않은(실생활의) 얼굴 이미지에서 연령대 및 성별 추정을 위해 ImageNet에서의 사전 훈련과 IMDB-WIKI-101 및 Adience 데이터셋에서의 미세조정을 활용한다. 성별 기반 사전 훈련과 가중 손실 레이어라는 두 가지 새로운 메커니즘을 도입하여 성능을 크게 향상시켰으며, RoR-152를 사용해 Adience 벤치마크에서 67.34%의 정확도로 새로운 최고 성능 기록을 달성하였다.

ABSTRACT

Automatically predicting age group and gender from face images acquired in unconstrained conditions is an important and challenging task in many real-world applications. Nevertheless, the conventional methods with manually-designed features on in-the-wild benchmarks are unsatisfactory because of incompetency to tackle large variations in unconstrained images. This difficulty is alleviated to some degree through Convolutional Neural Networks (CNN) for its powerful feature representation. In this paper, we propose a new CNN based method for age group and gender estimation leveraging Residual Networks of Residual Networks (RoR), which exhibits better optimization ability for age group and gender classification than other CNN architectures.Moreover, two modest mechanisms based on observation of the characteristics of age group are presented to further improve the performance of age estimation.In order to further improve the performance and alleviate over-fitting problem, RoR model is pre-trained on ImageNet firstly, and then it is fune-tuned on the IMDB-WIKI-101 data set for further learning the features of face images, finally, it is used to fine-tune on Adience data set. Our experiments illustrate the effectiveness of RoR method for age and gender estimation in the wild, where it achieves better performance than other CNN methods. Finally, the RoR-152+IMDB-WIKI-101 with two mechanisms achieves new state-of-the-art results on Adience benchmark.

연구 동기 및 목표

  • 기존의 수작업 특징 추출 기법이 실패하는 제한되지 않은 실생활 얼굴 이미지에서 정확한 연령대 및 성별 추정 문제를 해결하기 위해.
  • 전략적 사전 훈련과 미세조정를 통해 소규모 데이터셋에서의 과적합 문제를 완화함으로써 딥 러닝 성능을 향상시키기 위해.
  • 도메인 특화된 아키텍처 및 훈련 수정을 도입하여 딥 네트워크의 최적화 및 표현 학습을 향상시키기 위해.
  • 딥 리소스 아키텍처를 사용하여 Adience 벤치마크에서 연령 및 성별 분류 분야에서 최고 성능을 달성하기 위해.

제안 방법

  • 이 논문은 연령 및 성별 추정에서 최적화 및 특징 표현을 향상시키기 위해 설계된 새로운 Residual Networks of Residual Networks (RoR) 아키텍처를 제안한다.
  • 노화 곡선에 기반하여 연령대에 따라 다른 손실 가중치를 할당하는 가중 손실 레이어를 도입하여 불균형한 연령 분포에서의 학습 효율성을 향상시킨다.
  • 엔드 투 엔드 미세조정 전에 성별 인식 특징 학습을 향상시키기 위해 성별 기반 사전 훈련 메커니즘을 적용한다.
  • RoR 모델은 일반적인 특징을 학습하기 위해 먼저 ImageNet에서 사전 훈련을 수행하고, 얼굴 전용 특징 학습을 위해 IMDB-WIKI-101에서 미세조정을 수행한 후, 최종적으로 Adience 데이터셋에서 분류를 위해 미세조정한다.
  • 이 프레임워크는 세 단계 훈련 파이프라인을 사용한다: ImageNet 사전 훈련, IMDB-WIKI-101에서의 미세조정, Adience 전용 미세조정을 통해 타겟 도메인에 적응시킨다.
  • 정규화를 위해 드롭패스와 드롭아웃을 사용한 잔차 블록을 활용하며, 깊이, 블록 유형, 하이퍼파라미터를 평가하여 성능을 최적화한다.

실험 결과

연구 질문

  • RQ1제한되지 않은 조건에서 표준 CNN보다 더 깊은 잔차 아키텍처인 RoR이 연령 및 성별 추정에서 더 우수한 성능을 낼 수 있는가?
  • RQ2ImageNet에서의 사전 훈련 후 IMDB-WIKI-101에서의 미세조정이 Adience와 같은 소규모 데이터셋에서 일반화 능력을 향상시키고 과적합을 줄이는 데 기여하는가?
  • RQ3제안된 메커니즘인 가중 손실 및 성별 기반 사전 훈련이 얼마나 연령 추정 정확도를 향상시키는가?
  • RQ4IMDB-WIKI와 같은 막대한 사전 훈련 데이터에 의존하지 않고도 RoR이 최고 성능을 달성할 수 있는가, 아니면 최적의 결과를 얻기 위해 여전히 이러한 데이터가 필요한가?

주요 결과

  • 두 가지 제안된 메커니즘을 모두 적용한 RoR-152+IMDB-WIKI-101 모델은 Adience 벤치마크에서 연령대 분류에 대해 새로운 최고 성능인 67.34%의 단일 모델 정확도를 달성하였다.
  • 두 메커니즘을 적용한 RoR-152 모델은 1-off 정확도가 97.51%에 달하여 테스트 세트에서 뛰어난 일반화 능력과 강건성을 보였다.
  • IMDB-WIKI-101 사전 훈련 없이도 Pre-RoR-58+SD 모델이 두 메커니즘을 적용했을 경우 64.17%의 정확도를 기록하여, IMDB-WIKI 사전 훈련 없이도 DEX를 초월하는 성능을 보였다.
  • 성별 기반 사전 훈련과 가중 손실의 조합은 VGG-16 및 ResNets-34를 포함한 다양한 아키텍처에서 성능 향상을 이끌어내어 이 방법의 유연성을 입증하였다.
  • IMDB-WIKI-101에서의 미세조정은 성능 향상에 크게 기여하였으며, RoR-34+IMDB-WIKI-101 모델은 ImageNet에서만 사전 훈련된 모델보다 66.91%의 정확도로 뛰어난 성능을 보였다.
  • 제거 실험 결과, 두 메커니즘이 성능 향상에 독립적으로 기여하며, 특히 불균형한 연령대 분포를 다룰 때 가중 손실 레이어가 매우 효과적이라는 것이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.