[논문 리뷰] FP-Age: Leveraging Face Parsing Attention for Facial Age Estimation in the Wild
이 논문은 제약 없는 환경에서 자세 및 표정 변화에도 불구하고 눈과 입과 같이 의미적으로 유의미한 얼굴 영역에 명시적으로 초점을 맞추기 위해 얼굴 파싱 주의를 활용하는 새로운 얼굴 연령 추정 프레임워크인 FP-Age를 제안한다. 사전 훈련된 얼굴 파싱 네트워크에서 추출한 군집 및 세분화된 특징을 전용 얼굴 파싱 주의 모듈을 통해 통합함으로써, FP-Age는 내부 및 교차 데이터셋 평가 프로토콜 모두에서 IMDB-Clean 및 여러 벤치마크 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성한다.
Image-based age estimation aims to predict a person's age from facial images. It is used in a variety of real-world applications. Although end-to-end deep models have achieved impressive results for age estimation on benchmark datasets, their performance in-the-wild still leaves much room for improvement due to the challenges caused by large variations in head pose, facial expressions, and occlusions. To address this issue, we propose a simple yet effective method to explicitly incorporate facial semantics into age estimation, so that the model would learn to correctly focus on the most informative facial components from unaligned facial images regardless of head pose and non-rigid deformation. To this end, we design a face parsing-based network to learn semantic information at different scales and a novel face parsing attention module to leverage these semantic features for age estimation. To evaluate our method on in-the-wild data, we also introduce a new challenging large-scale benchmark called IMDB-Clean. This dataset is created by semi-automatically cleaning the noisy IMDB-WIKI dataset using a constrained clustering method. Through comprehensive experiment on IMDB-Clean and other benchmark datasets, under both intra-dataset and cross-dataset evaluation protocols, we show that our method consistently outperforms all existing age estimation methods and achieves a new state-of-the-art performance. To the best of our knowledge, our work presents the first attempt of leveraging face parsing attention to achieve semantic-aware age estimation, which may be inspiring to other high level facial analysis tasks. Code and data are available on \url{https://github.com/ibug-group/fpage}.
연구 동기 및 목표
- 자세, 표정 및 가림 현상의 변동으로 인해 모델 정확도가 저하되는 제약 없는, 자연계 환경에서의 얼굴 연령 추정 성능 향상.
- 눈, 코, 입과 같은 얼굴의 의미 정보를 명시적으로 연령 추정에 통합하여 더 유의미한 영역에 주의를 기울이기.
- IMDB-WIKI에서 노이즈 있는 샘플을 반자동으로 제거하여 자연계 연령 추정을 위한 청소된 대규모 벤치마크 데이터셋을 개발하기.
- 다양한 얼굴 부위가 연령 추정에 어떻게 기여하는지 확인하고, 특히 코가 가장 정보가 적은 것으로 밝혀지기.
- 의미 특징 학습과 주의 메커니즘을 종합적으로 통합한 엔드 투 엔드 훈련 가능한 프레임워크를 통해 새로운 최신 기술 수준을 확립하기.
제안 방법
- 사전 훈련된 얼굴 파싱 네트워크를 사용하여 입력 얼굴 이미지에서 다중 스케일 의미 특징을 추출함으로써 얼굴 영역의 근본적이고 세분화된 표현을 제공한다.
- 특히 눈과 입 부근의 가장 정보가 많은 의미 특징에 동적으로 가중치를 주고 주목하기 위해, 새로운 얼굴 파싱 주의(FPA) 모듈을 설계하였다.
- 저수준 및 고수준 특징을 학습된 얼굴 파싱 마스크와 결합하여 연령 예측을 위한 통합 표현을 형성한다.
- 학습 가능한 주의 메커니즘을 사용하여 의미 인식 특징을 집계함으로써 추가적인 파싱 애너테이션 없이도 특징의 구분 능력을 향상시킨다.
- 전체 FP-Age 네트워크는 표준 연령 추정 손실을 사용하여 엔드 투 엔드로 훈련되며, 파싱 인식 주의와 연령 예측의 공동 최적화를 가능하게 한다.
- IMDB-WIKI 데이터셋에 제약 조건이 있는 클러스터링 기반의 반자동 데이터 정제 파이프라인을 적용하여 새로운 IMDB-Clean 벤치마크를 생성함으로써 노이즈를 감소시키고 데이터 품질을 향상시켰다.
![Figure 1: FP-Age. A pre-trained face parsing framework [ 4 ] (top) is used to extract features of the target face in the input image. A lightweight network (bottom) aggregates low-level features, high-level features and face masks to predict the age. The shapes of tensors are labelled by the blocks](https://ar5iv.labs.arxiv.org/html/2106.11145/assets/x1.png)
실험 결과
연구 질문
- RQ1주의 메커니즘을 통해 얼굴 의미 부위를 명시적으로 모델링하면 제약 없는 자연계 환경에서 연령 추정 성능이 향상되는가?
- RQ2다양한 얼굴 부위(예: 눈, 입, 코)는 연령 추정 정확도에 어떻게 기여하는가? 그리고 어떤 부위가 가장 정보가 많은가?
- RQ3추가 애너테이션 없이도 사전 훈련된 얼굴 파싱 네트워크를 효과적으로 활용하여 연령 추정 성능을 향상시킬 수 있는가?
- RQ4제안된 얼굴 파싱 주의 메커니즘이 다양한 데이터셋과 평가 프로토콜에서 더 견고하고 정확한 연령 예측을 이끌어내는가?
- RQ5정제된 대규모 벤치마크인 IMDB-Clean은 연령 추정에서 더 신뢰할 수 있고 일반화된 성능 향상을 이끌어낼 수 있는가?
주요 결과
- FP-Age는 교차 데이터셋 평가에서 IMDB-Clean 데이터셋에서 평균 절대 오차(MAE) 5.60을 기록하며 이전 방법들보다 뚜렷이 뛰어난 성능을 보였다.
- FG-Net 데이터셋에서 FP-Age는 MAE 6.81과 CS5 점수 48.49를 기록하여 모든 이전 방법을 압도하는 성능을 보였다.
- 통계적 유의성 검정 결과, FP-Age의 성능은 여덟 가지 경쟁 방법보다 유의미하게 뛰어나며, 보너페리 보정을 통한 p-값은 모두 1e-100 이하였다.
- 코 영역는 연령 추정에 가장 정보가 적은 것으로 밝혀졌고, 눈과 입 모서리는 정확한 예측에 있어 항상 더 중요한 역할을 했다.
- 모델은 다양한 데이터셋에서 뛰어난 성능을 보였으며, Morph, CACD, KANFace, FG-Net 데이터셋에서 내부 및 교차 데이터셋 프로토콜 모두에서 최신 기술 수준 성능을 달성했다.
- 제거 실험 결과, 얼굴 파싱 주의 모듈이 성능 향상에 뚜렷한 기여를 함을 확인하였으며, 의미적으로 관련 있는 얼굴 부위에 주의를 이끌어내는 데서 그 역할을 입증하였다.
![Figure 2: RoI Tanh-polar Transform [ 4 ] warps the whole image to a fix-sized representation in the Tanh-polar space with the given bounding box.](https://ar5iv.labs.arxiv.org/html/2106.11145/assets/x2.png)
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.