[논문 리뷰] Grand Challenge of 106-Point Facial Landmark Localization
이 논문은 106개 점으로 표시된 고해상도 얼굴 랜드마크를 포함한 대규모이고 다양한 얼굴 랜드마크 데이터셋인 JD-landmark 데이터셋을 제시하며, ICME 2019에서 고정밀 얼굴 랜드마크 정렬 기술을 발전시키기 위한 대규모 챌린지를 주최했다. 챌린지는 자세, 표정, 가림 등 복잡한 변화를 평가하며, Baidu Inc.의 autoML 및 투표 기반 다중 스택 얼굴 정렬 기법이 최고 성능을 기록했으며(AUC: 84.01%) 정확성과 강인성 면에서 기존 최고 수준의 방법들을 능가했다.
Facial landmark localization is a very crucial step in numerous face related applications, such as face recognition, facial pose estimation, face image synthesis, etc. However, previous competitions on facial landmark localization (i.e., the 300-W, 300-VW and Menpo challenges) aim to predict 68-point landmarks, which are incompetent to depict the structure of facial components. In order to overcome this problem, we construct a challenging dataset, named JD-landmark. Each image is manually annotated with 106-point landmarks. This dataset covers large variations on pose and expression, which brings a lot of difficulties to predict accurate landmarks. We hold a 106-point facial landmark localization competition1 on this dataset in conjunction with IEEE International Conference on Multimedia and Expo (ICME) 2019. The purpose of this competition is to discover effective and robust facial landmark localization approaches.
연구 동기 및 목표
- 기존 68점 얼굴 랜드마크 기준이 얼굴 구성 요소의 구조적 세부 정보를 충분히 제공하지 못하는 한계를 보완하기 위해, 더 세밀한 106점 레이블링 표준을 도입하기 위해.
- 자세, 표정, 가림 등 상당한 변동성이 있는 대규모이고 다양한 얼굴 랜드마크 데이터셋(JD-landmark)을 구축하여 기존 기법들을 시험하기 위해.
- ICME 2019에서 대규모 챌린지 경연을 통해 강인하고 정확한 얼굴 랜드마크 정렬 기술의 발전을 촉진하기 위해.
- 실제 환경, 특히 제약 없는 환경을 고려한 표준화된 벤치마크에서 최신 딥 러닝 모델의 성능을 평가하고 비교하기 위해.
제안 방법
- JD-landmark 데이터셋은 약 16,000장의 이미지로 구성되며, 훈련 세트 11,393장, 검증 세트 2,000장, 테스트 세트 2,000장으로 나뉘며, 모두 수작업으로 106개의 정밀한 얼굴 랜드마크로 레이블링되었다.
- 평가 지표는 경계 상자 면적의 제곱근으로 정규화된 평균 오차(NME)를 사용하며, 실패는 NME > 8%로 정의된다.
- 우수한 성능을 기록한 Baidu Inc.의 방법은 autoML로 최적화된 기본 모델을 사용한 다중 스택 아워글래스 아키텍처를 채택하였으며, 이상치를 거부하고 강인성을 향상시키기 위해 투표 전략을 통해 통합하였다.
- USTC에서 제출한 두 번째로 높은 성능의 방법은 다중 스케일 중간 감시와 통합 회귀를 통해 히트맵의 argmax 양자화를 피하는 Densely U-Nets Refine Network(DURN)을 사용하였다.
- Meituan에서 제출한 세 번째로 높은 성능의 방법은 히트맵을 연속적인 좌표로 매핑하기 위해 이중 소프트 argmax를 갖는 계층적 모듈을 도입하여 양자화 오차를 감소시켰으며, 다양한 입력 및 출력 해상도로 여러 모델을 훈련시켰다.
- 모든 상위 성능 기법은 고도화된 데이터 증강, 다중 작업 학습(예: 세분화), 모델 앙상블 기법을 통합하여 어려운 자세와 가림 상황에서도 일반화 능력을 향상시켰다.
실험 결과
연구 질문
- RQ1표준 68점 기준에 비해 눈썹, 코 날개 등 복잡한 얼굴 구성 요소에 대해 106점 랜드마크 레이블링 체계가 더 세밀한 구조적 정보를 제공할 수 있는가?
- RQ2고해상도 106점 기준을 사용할 때, 최신 딥 러닝 모델은 자세, 표정, 가림의 극한 변화 상황에서 어떻게 성능을 발휘하는가?
- RQ3autoML, 다중 스케일 감시, 소프트 argmax 연산이 제약 없는 환경에서 정렬 정확성과 강인성을 얼마나 향상시킬 수 있는가?
- RQ4실제 환경 조건에서 밀도 높은 얼굴 랜드마크 정렬 작업에서, 엔드 투 엔드 학습 가능한 프레임워크와 앙상블 기반 접근 방식 사이의 성능 격은 어느 정도인가?
주요 결과
- Baidu Inc.의 최고 성능 기법은 CED 곡선에서 최고의 AUC 84.01%를 기록하여, 두 번째 및 세 번째로 높은 성능을 기록한 팀보다 각각 1.33%, 1.79% 높은 성능을 보였다.
- Baidu의 방법은 평균 NME 1.31%를 기록하여, USTC의 1.41% 및 Meituan의 1.42%에 비해 뛰어난 정확성을 보였다.
- 실패율은 Baidu의 방법이 0.10%로 가장 낮아 어려운 케이스 처리에서 뛰어난 강인성을 보였다.
- USTC에서 제출한 두 번째로 높은 성능의 방법은 실패율 0.05%를 기록하여 모든 팀 중에서 가장 낮았으며, 어려운 샘플에 대한 뛰어난 신뢰성을 보였다.
- Meituan에서 제출한 세 번째로 높은 성능의 방법은 실패율 0.00%를 기록하여 테스트 세트에서 실패 예측가 없었으며, 평균 NME는 약간 높은 편이었다.
- 상위 3개의 방법 모두 테스트 세트에서 강력한 일반화 능력을 보였으며, CED 곡선 분석 결과 80% 이상의 테스트 이미지에서 NME가 8% 이하로 유지되어 데이터셋의 도전성과 타당성을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.