Skip to main content
QUICK REVIEW

[논문 리뷰] It's Written All Over Your Face: Full-Face Appearance-Based Gaze Estimation

Xucong Zhang, Yusuke Sugano|arXiv (Cornell University)|2016. 11. 27.
Gaze Tracking and Assistive Technology참고 문헌 29인용 수 6
한 줄 요약

이 논문은 공간적으로 적응형 가중치를 갖는 컨volution 신경망을 사용하여 정보성 있는 얼굴 부위를 동적으로 강조함으로써 전면적 외형 기반의 시선 추정 방법을 제안한다. 이는 MPIIGaze에서 3D 시선 추정 정확도를 14.3% 향상시키고 EYEDIAP에서 27.7% 향상시켜, 극한의 머리 자세와 다양한 조명 조건에서도 최신 기술 수준을 달성한다.

ABSTRACT

Eye gaze is an important non-verbal cue for human affect analysis. Recent gaze estimation work indicated that information from the full face region can benefit performance. Pushing this idea further, we propose an appearance-based method that, in contrast to a long-standing line of work in computer vision, only takes the full face image as input. Our method encodes the face image using a convolutional neural network with spatial weights applied on the feature maps to flexibly suppress or enhance information in different facial regions. Through extensive evaluation, we show that our full-face method significantly outperforms the state of the art for both 2D and 3D gaze estimation, achieving improvements of up to 14.3% on MPIIGaze and 27.7% on EYEDIAP for person-independent 3D gaze estimation. We further show that this improvement is consistent across different illumination conditions and gaze directions and particularly pronounced for the most challenging extreme head poses.

연구 동기 및 목표

  • 전면적 외형 기반 접근 방식이 시선 추정에서 눈 전용 또는 다중 영역 방법을 능가할 수 있는지 조사하는 것.
  • 다양한 조명, 머리 자세, 시선 방향 조건에서 정확한 시선 추정에 가장 기여하는 얼굴 부위를 규명하는 것.
  • 명시적인 영역 주석이 필요 없이 공간적으로 변하는 얼굴 부위 중요도를 효율적으로 인코딩할 수 있는 딥 러닝 아키텍처를 개발하는 것.
  • 극한의 실생활 조건, 예를 들어 극한의 머리 자세와 방향성 조명에 대한 방법의 강건성을 평가하는 것.
  • 개인에 관계없이 적용 가능한 3D 시선 추정을 위한 얼굴 전용 입력 파이프라인의 실현 가능성과 우수성을 입증하는 것.

제안 방법

  • 기본적인 CNN 아키텍처를 사용하여 전면 이미지를 입력으로 받아 직접 2D 또는 3D 시선 방향을 회귀한다.
  • 특징 맵 상의 각 위치에 대해 주의 가중치를 학습하는 공간적 가중치 메커니즘을 도입하여 다양한 얼굴 부위의 정보를 동적으로 억제하거나 강화할 수 있도록 한다.
  • 공간적 가중치는 컨volution 레이어의 활성화 맵에 학습 가능한 파라미터로서 적용되어 네트워크가 관련된 얼굴 영역에 자동으로 집중할 수 있도록 한다.
  • 영역 중요도 분석은 제거 실험을 통해 수행되며, 특정 얼굴 부위를 마스킹한 후 정확도 감소율을 측정하여 상대적 중요도를 평가한다.
  • 세 개의 얼굴 기준점(왼쪽/오른쪽 눈꼬리, 입꼬리)을 사용하여 얼굴 이미지와 중요도 맵을 정렬하여 다양한 피험자 간 일관된 비교를 가능하게 한다.
  • MPIIGaze와 EYEDIAP 데이터셋에서 사람을 한 명씩 제외하는 교차 검증 방식을 사용하여 모델을 훈련하고 평가한다.

실험 결과

연구 질문

  • RQ1전면적 외형 기반의 시선 추정 방법이 3D 시선 추정에서 기존의 눈 전용 또는 다중 영역 방법을 능가할 수 있는가?
  • RQ2다양한 조명, 머리 자세, 시선 방향 조건에서 시선 추정에 가장 정보성 있는 얼굴 부위는 무엇인가?
  • RQ3제안된 공간적 가중치 메커니즘이 극한의 머리 자세와 조명 변화에 대한 강건성을 향상시키는가?
  • RQ4눈 영역만 또는 여러 얼굴 영역을 사용하는 방법과 비교해 얼굴 전용 입력의 성능은 어떠한가?
  • RQ5전면적 접근 방식은 저해상도 이미지 또는 도전적인 실외 조건에서 특히 유익한가?

주요 결과

  • 제안된 전면적 방법은 MPIIGaze 데이터셋에서 3D 시선 추정 정확도 4.8°를 달성하여 이전 최고 기술 대비 14.3% 향상되었다.
  • EYEDIAP 데이터셋에서는 3D 시선 추정 정확도 6.0°를 기록하여 개인 간 평가에서 이전 최고 기술 대비 27.7% 향상되었다.
  • 모든 조명 조건에서 일관된 성능 향상을 보였으며, 특히 강한 방향성 조명 조건에서 가장 두드러진 향상이 관찰되었다.
  • 영역 중요도 분석 결과, 시선 방향이 점점 더 극단적이게 되면서 눈 외 영역의 중요성이 증가하는 것으로 나타났으며, 특히 측면 시선에서 두드러졌다.
  • 극한의 머리 자세 조건에서 전면 입력은 눈 전용 기반 베이스라인보다 훨씬 우수한 성능을 보였으며, 눈 외 영역이 추정 정확도 향상에 더 기여하였다.
  • 공간적 가중치 메커니즘은 네트워크가 영역별 주의를 학습하도록 하였으며, 방향성 조명 조건에서 더 밝은 쪽의 얼굴 영역에 더 높은 중요도를 할당하는 경향을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.