Skip to main content
QUICK REVIEW

[논문 리뷰] A Coarse-to-Fine Adaptive Network for Appearance-Based Gaze Estimation

Yihua Cheng, Shiyao Huang|arXiv (Cornell University)|2020. 01. 01.
Gaze Tracking and Assistive Technology참고 문헌 30인용 수 13
한 줄 요약

이 논문은 외관 기반 3D 시선 추정을 위한 코arse-to-fine 적응형 네트워크인 CA-Net을 제안한다. 이는 얼굴 영상으로 코arse 시선 예측을 수행하고, 눈 영상으로 잔차 보정을 수행한다. 이중어휘 모델을 통해 기본 시선과 잔차를 결합하고, 주의 메커니즘을 통해 좌우 눈 특징을 적응적으로 가중함으로써, MPIIGaze(4.14°) 및 EyeDiap 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Human gaze is essential for various appealing applications. Aiming at more accurate gaze estimation, a series of recent works propose to utilize face and eye images simultaneously. Nevertheless, face and eye images only serve as independent or parallel feature sources in those works, the intrinsic correlation between their features is overlooked. In this paper we make the following contributions: 1) We propose a coarse-to-fine strategy which estimates a basic gaze direction from face image and refines it with corresponding residual predicted from eye images. 2) Guided by the proposed strategy, we design a framework which introduces a bi-gram model to bridge gaze residual and basic gaze direction, and an attention component to adaptively acquire suitable fine-grained feature. 3) Integrating the above innovations, we construct a coarse-to-fine adaptive network named CA-Net and achieve state-of-the-art performances on MPIIGaze and EyeDiap.

연구 동기 및 목표

  • 기존의 외관 기반 시선 추정 방법이 얼굴 영상과 눈 영상을 독립적인 특징 소스로 간주하여 그 내재된 상관관계를 간과한다는 한계를 해결하기 위해.
  • 코arse 그레인의 얼굴 특징와 테이너 그레인의 눈 특징의 상보성을 활용하여 시선 추정 정확도를 향상시키기 위해.
  • 코어스-투-파인 방식으로 얼굴 및 눈 영상에서 다중 수준의 특징을 적응적으로 융합하는 프레임워크를 설계하기 위해.
  • 표준 벤치마크에서의 추론 및 비교 실험을 통해 제안된 코어스-투-파인 전략의 유효성을 검증하기 위해.

제안 방법

  • 코어스-투-파인 전략을 제안: 먼저 얼굴 영상 특징으로 기본 시선 방향을 추정한 후, 눈 영상 특징으로 예측된 시선 잔차를 이용해 보정한다.
  • 기본 시선 방향과 예측된 시선 잔차 간의 종속성을 명시적으로 모델링하기 위해 이중어휘 모델을 도입하여 잔차 추정 정확도를 향상시킨다.
  • 얼굴 및 눈 영상 특징을 기반으로 좌우 눈 특징에 대해 가중치를 적응적으로 할당하는 주의 구성 요소를 활용하여, 관련 있는 테이너 그레인 정보를 동적으로 선택한다.
  • 코어스-투-파인 전략, 이중어휘 모델링, 적응형 주의 메커니즘을 통합한 엔드 투 엔드 딥 러닝 프레임워크인 CA-Net을 구축한다.
  • 기본 시선 방향과 시선 잔차를 벡터 덧셈으로 조합하여 최종 시선 예측 결과를 도출한다.
  • 특징 추출을 위해 CNN을 활용한다: 하나는 얼굴 영상(코어스 특징)용, 다른 하나는 눈 영상(테이너 그레인 특징)용.

실험 결과

연구 질문

  • RQ1이중어휘 모델링과 적응형 주의 메커니즘을 활용한 코어스-투-파인 전략이, 얼굴 및 눈 영상을 평행 입력으로 간주하는 것보다 시선 추정 정확도를 향상시키는가?
  • RQ2기본 시선 방향과 시선 잔차 간의 관계를 모델링하는 데 있어 이중어휘 모델의 효과는 어떠한가?
  • RQ3좌우 눈 특징에 대해 적응적으로 가중치를 할당하는 주의 메커니즘이 시선 추정의 정확도와 내성에 기여하는가?
  • RQ4시선 추정에서 코어스-투-파인 전략이 역순인 테이너-투-코어스 접근보다 더 효과적인가?
  • RQ5MPIIGaze 및 EyeDiap와 같은 표준 벤치마크에서 제안된 CA-Net은 기존 최신 기술 수준(SOTA) 방법보다 우수한가?

주요 결과

  • CA-Net은 MPIIGaze 벤치마크에서 평균 오차 4.14°를 기록하여 이전 최신 기술 수준(SOTA) 방법을 초월한다.
  • 코어스-투-파인 전략은 테이너-투-코어스 대비 유의미하게 뛰어나며, 평균 오차에서 0.49° 향상되었다.
  • 이중어휘 모델은 일중어휘 기반 모델 대비 0.29° 향상된 성능을 기록하여, 시선 방향-잔차 종속성 모델링의 가치를 입증한다.
  • 제안된 주의 구성 요소는 얼굴 전용 및 눈 전용 주의 기반 모델보다 뛰어난 성능을 보이며, 특징 가중치 할당의 효과성을 확인한다.
  • 제거 실험 결과, 이중어휘 모델링과 적응형 주의 메커니즘의 조합이 가장 우수한 성능을 내며, 구성 요소 간의 상호보완성을 검증한다.
  • 시각적 결과는 CA-Net이 다양한 머리 자세와 시선 방향, 특히 시선이 얼굴 중심에서 벗어난 경우에도 잘 일반화됨을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.