[논문 리뷰] AnchorFace: An Anchor-based Facial Landmark Detector Across Large Poses
AnchorFace는 자세에 따라 다릅니다. 각 자세 유형에 맞는 앵커 템플릿을 사용하여 회귀 검색 공간을 분할하고, 신뢰도 가중치를 적용해 예측을 통합함으로써 대량의 자세 변화에 대비한 정확도와 강건성을 향상시키는 앵커 기반 얼굴 랜드마크 검출 프레임워크를 제안합니다. 이는 AFLW, 300W, Menpo, WFLW 벤치마크에서 약 45 FPS의 추론 속도를 기록하며 최신 기술 수준의 성능을 달성합니다.
Facial landmark localization aims to detect the predefined points of human faces, and the topic has been rapidly improved with the recent development of neural network based methods. However, it remains a challenging task when dealing with faces in unconstrained scenarios, especially with large pose variations. In this paper, we target the problem of facial landmark localization across large poses and address this task based on a split-and-aggregate strategy. To split the search space, we propose a set of anchor templates as references for regression, which well addresses the large variations of face poses. Based on the prediction of each anchor template, we propose to aggregate the results, which can reduce the landmark uncertainty due to the large poses. Overall, our proposed approach, named AnchorFace, obtains state-of-the-art results with extremely efficient inference speed on four challenging benchmarks, i.e. AFLW, 300W, Menpo, and WFLW dataset. Code will be available at https://github.com/nothingelse92/AnchorFace.
연구 동기 및 목표
- 대규모 자세 변화 하에서 얼굴 랜드마크 정렬 문제를 해결하기 위해, 기존의 회귀 방법이 높은 불확실성과 오차를 겪는 문제를 해결한다.
- 다양한 얼굴 자세에 대응하는 사전 정의된 앵커 템플릿을 사용해 검색 공간을 분할함으로써 랜드마크 회귀의 복잡성을 감소시킨다.
- 다양한 앵커에서의 예측을 신뢰도 가중 평균 방법으로 통합함으로써 가림 및 노이즈가 있는 레이블에 대한 강건성을 향상시킨다.
- 실제로 제약 조건이 없는 환경에서의 구현을 고려해 고정확도를 유지하면서도 실시간 추론 속도를 확보한다.
제안 방법
- 이 방법은 분할 및 통합 전략을 사용한다: 먼저 K-means 클러스터링 또는 수작업으로 설계된 템플릿에서 유도된 앵커 템플릿 세트를 사용해 다양한 자세 변화에 대응하는 검색 공간을 분할한다.
- 각 앵커 템플릿에 대해, 경량 기반 네트워크(예: ShuffleNet-V2)를 사용해 앵커에서 진짜 랜드마크 위치까지의 2D 오프셋을 회귀한다.
- 각 앵커 예측의 신뢰도를 예측하는 별도의 신뢰도 브랜치가 존재하며, 이는 모든 앵커의 결과를 신뢰도 가중치에 따라 통합할 수 있도록 한다.
- 최종 랜드마크 좌표는 모든 앵커 예측의 가중 평균으로 계산되며, 가중치는 예측된 신뢰도이다. 이는 모호하거나 가려진 랜드마크에서 발생하는 불확실성을 줄인다.
- 앵커 템플릿은 기준 템플릿을 요, 피치, 롤 차원에서 변형하여 훈련 데이터의 대량 자세 변화를 커버하도록 생성된다.
- 앵커 면적(56×56), 앵커 그리드(7×7), 템플릿 수(24)와 같은 하이퍼파라미터는 정확도와 효율성의 균형을 맞추기 위해 탐색 실험을 통해 최적화된다.
실험 결과
연구 질문
- RQ1대량 자세 변화 하에서 앵커 기반 설계가 랜드마크 정렬의 회귀 난이도를 효과적으로 줄일 수 있는가?
- RQ2다수의 앵커 예측을 신뢰도 가중 평균으로 통합함으로써 가림 및 레이블 노이즈에 대한 강건성이 어떻게 향상되는가?
- RQ3정확도와 추론 속도의 균형을 고려할 때 앵커 템플릿, 앵커 면적, 앵커 그리드의 최적 구성은 무엇인가?
- RQ4제안된 분할 및 통합 전략이 직접 회귀 및 기존 최신 기술 수준의 방법보다 대량 자세 벤치마크에서 더 우수한 성능을 내는가?
주요 결과
- AnchorFace는 AFLW, 300W, Menpo, WFLW 등 네 가지 대량 자세 벤치마크에서 최신 기술 수준의 성능을 달성했으며, 기준 회귀 모델 대비 평균 오차를 최대 10%까지 감소시켰다.
- 신뢰도 가중 통합 전략은 argmax 및 평균 통합 방식을 모두 능가하며, 모든 벤치마크에서 평균 오차를 0.02~0.16 감소시켰다.
- K-means 클러스터링을 통해 생성된 24개의 앵커 템플릿이 수작업 설계된 템플릿보다 더 우수한 성능을 보였으며, 데이터 기반 템플릿 설계가 더 효과적임을 시사한다.
- 최적의 앵커 면적은 이미지 중심 부근의 56×56이며, 7×7 앵커 그리드가 정확도와 계산 비용 사이의 최적의 균형을 이룬다.
- 단일 NVIDIA Titan Xp GPU에서 약 45 FPS의 추론 속도를 기록하여 실시간 기능을 입증했으며, 실질적인 구현에 적합함을 보였다.
- 아블레이션 연구 결과, 앵커 기반 회귀는 모든 자세 유형에서 오차를 0.1~0.3 감소시켰으며, 특히 극단적인 요, 피치 각도에서 두드러진 성능 향상을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.