Skip to main content
QUICK REVIEW

[논문 리뷰] Shape Preserving Facial Landmarks with Graph Attention Networks

Andrés Prados-Torreblanca, José M. Buenaposada|arXiv (Cornell University)|2022. 10. 13.
Face recognition and analysis인용 수 6
한 줄 요약

이 논문은 CNN 기반 아키텍처와 단계적 그래프 주의망(GAT)의 조합을 통해 국소적 외형과 전역 기하학적 관계를 동시에 학습하는 새로운 얼굴 랜드마크 검출 모델인 SPIGA를 제안한다. 위치 인코딩, 주의 메커니즘, 그리고 굵은-세밀한 보정 전략을 통합함으로써 SPIGA는 특히 가림, 흐림, 극단적인 조명 조건과 같은 도전적인 상황에서도 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Top-performing landmark estimation algorithms are based on exploiting the excellent ability of large convolutional neural networks (CNNs) to represent local appearance. However, it is well known that they can only learn weak spatial relationships. To address this problem, we propose a model based on the combination of a CNN with a cascade of Graph Attention Network regressors. To this end, we introduce an encoding that jointly represents the appearance and location of facial landmarks and an attention mechanism to weigh the information according to its reliability. This is combined with a multi-task approach to initialize the location of graph nodes and a coarse-to-fine landmark description scheme. Our experiments confirm that the proposed model learns a global representation of the structure of the face, achieving top performance in popular benchmarks on head pose and landmark estimation. The improvement provided by our model is most significant in situations involving large changes in the local appearance of landmarks.

연구 동기 및 목표

  • 얼굴 랜드마크 간의 장거리 공간적 관계를 모델링하는 데에 한계가 있는 CNN의 문제점을 해결한다.
  • 가림, 흐림, 과도한 메이크업, 극단적인 조명 조건과 같은 도전적인 상황에서의 강건성을 향상시킨다.
  • 고정밀한 랜드마크 정렬을 유지하면서도 전역적이고 형태를 유지하는 얼굴 기하학의 표현을 학습한다.
  • 다중 작업 학습과 구조적 초기화를 통해 개선된 수렴성을 확보한 엔드 투 엔드 훈련을 가능하게 한다.
  • 특히 외형의 모호성이 있는 경우를 포함한 어려운 케이스를 포함한 벤치마크 데이터셋에서 기존 방법들을 능가한다.

제안 방법

  • 고품질의 국소적 외형 표현을 위한 다단계 히트맵 기반 CNN 기반 아키텍처를 사용한다.
  • 랜드마크의 외형과 공간적 위치를 함께 표현하는 위치 인코딩을 도입하여 GAT 입력을 향상시킨다.
  • 학습 가능한 주의 메커니즘을 갖춘 그래프 주의망(GAT)을 활용하여 랜드마크 간의 장거리 기하학적 의존성을 모델링한다.
  • 각 회귀 단계에서 주의가 먼 랜드마크에서 가까운 랜드마크로 이동하는 굵은-세밀한 특징 추출 전략을 구현한다.
  • 랜드마크 위치의 정확한 초기화를 위해 헤드 포즈 추정을 위한 다중 작업 헤드로 백본을 훈련시킨다.
  • 각 GAT 단계에서 그래프 구조를 기반으로 맥락 인식 주의를 사용하여 랜드마크 위치를 개선하는 계단식 회귀 프레임워크를 적용한다.

실험 결과

연구 질문

  • RQ1위치 인코딩과 주의 메커니즘을 갖춘 GAT 기반 회귀자로 인해 기존 CNN 대비 얼굴 랜드마크 검출에서 전역 기하학적 모델링이 향상되는가?
  • RQ2굵은-세밀한 주의 메커니즘이 외형이 모호하거나 열악한 경우 성능에 어떤 영향을 미치는가?
  • RQ3헤드 포즈 추정과의 다중 작업 학습이 랜드마크 초기화 및 전체 수렴에 얼마나 기여하는가?
  • RQ4각 아키텍처 구성 요소(예: 위치 인코딩, 주의, 계단 깊이)가 최종 성능에 기여하는 정도는 어느 정도인가?
  • RQ5기존 최신 기술 수준의 방법들과 비교해 볼 때, 모델이 가림, 흐림, 메이크업 등의 어려운 케이스로 일반화되는 정도는 어떠한가?

주요 결과

  • SPIGA는 WFLW, COFW-68, MERL-RAV 데이터셋에서 최신 기술 수준의 성능을 달성했으며, WFLW 테스트 세트에서 NME가 4.06을 기록했다.
  • WFLW에서 NPE90이 6.76으로 감소하여 도전적인 조건에서도 뛰어난 강건성을 입증했다.
  • 위치 인코딩이 성능 향상에 가장 크게 기여했으며, 이를 생략한 모델 대비 하드 서브셋에서 최대 0.32 NME 포인트의 성능 향상을 보였다.
  • 굵은-세밀한 주의 메커니즘이 고정된 윈도우 크기(w=8 또는 w=1) 대비 성능 향상을 보였으며, 특히 가림과 흐림 상황에서 두드러졌다.
  • 첫 번째 GAT 레이어는 먼, 신뢰할 수 있는 랜드마크를 주시하는 반면, 후속 레이어는 가까운 랜드마크에 집중함으로써 효과적인 전역-국소 보정이 이루어지고 있음을 시사한다.
  • 3단계 계단식 구조가 정확도와 강건성 사이의 최적의 균형을 이룩했으며, FR10이 2.60에서 2.08로 감소하여 이상치 제거 능력 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.