Skip to main content
QUICK REVIEW

[논문 리뷰] GEDDnet: A Network for Gaze Estimation with Dilation and Decomposition

Zhaokang Chen, Bertram E. Shi|arXiv (Cornell University)|2020. 01. 25.
Gaze Tracking and Assistive Technology참고 문헌 50인용 수 12
한 줄 요약

GEDDnet는 확장된 컨volution을 사용하여 미세한 눈의 외형 변화를 포착하고, 주관적 독립적 눈의 방향 예측과 주관적 의존적 편향을 분리하는 눈의 분해 방법을 활용한 새로운 딥러닝 프레임워크를 제안한다. 단 한 장 또는 몇 장의 타겟 이미지로 최소한의 校정을 통해 최신 기술 수준의 정확도를 달성하며, 오차를 최대 35.6% 감소시키고 校정 없이도 이전 방법보다 6.3% 이상 뛰어난 성능을 내며 승리한다.

ABSTRACT

Appearance-based gaze estimation from RGB images provides relatively unconstrained gaze tracking from commonly available hardware. The accuracy of subject-independent models is limited partly by small intra-subject and large inter-subject variations in appearance, and partly by a latent subject-dependent bias. To improve estimation accuracy, we propose to use dilated-convolutions in a deep convolutional neural network to capture subtle changes in the eye images, and a novel gaze decomposition method that decomposes the gaze angle into the sum of a subject-independent gaze estimate from the image and a subject-dependent bias. To further reduce estimation error, we propose a calibration method that estimates the bias from a few images taken as the subject gazes at only a few or even just a single gaze target. This significantly redues calibration time and complexity. Experiments on four datasets, including a new dataset we collected containing large variations in head pose and face location, indicate that even without calibration the estimator already outperforms state-of-the-art methods by more than 6.3%. The proposed calibration method is robust to the location of calibration target and reduces estimation error significantly (up to 35.6%), achieving state-of-the-art performance with much less calibration data than required by previously proposed methods.

연구 동기 및 목표

  • RGB 기반 눈의 방향 추정에서 큰 개인 간 차이와 작은 개인 내 차이를 해결하기 위한 도전에 대응한다.
  • 개인별 의존적 편향을 단 한 장 또는 몇 장의 눈의 목표 이미지에서 추정함으로써 校정 시간과 복잡성을 줄인다.
  • 개인별 독립적 및 개인별 의존적 구성요소의 합으로 눈의 방향을 모델링함으로써 추정 정확도를 향상시킨다.
  • 기존 방법보다 훨씬 적은 校정 데이터로 최신 기술 수준의 성능을 달성한다.

제안 방법

  • 다양한 머리 자세와 얼굴 외형에서 눈 이미지의 미세한 공간적 변동을 포착하기 위해 깊이 신경망에 확장된 컨볼루션을 적용한다.
  • 이미지 특징에서 유도된 주관적 독립적 성분과 주관적 의존적 편향으로 눈의 각도를 분리하는 눈의 분해 기법을 도입한다.
  • 시험 대상이 목표를 향해 바라보는 단 한 장 또는 몇 장의 校정 이미지를 사용하여 주관적 의존적 편향을 추정하는 校정 방법을 설계한다.
  • 예측된 눈의 방향 각도와 진짜 눈의 방향 각도 간 오차를 최소화하는 손실 함수를 사용하여 네트워크를 종합적으로 학습시킨다.
  • 일반화 능력과 강건성을 평가하기 위해 큰 머리 자세 및 얼굴 위치 변화를 포함한 새로운 데이터셋을 사용한다.

실험 결과

연구 질문

  • RQ1확장된 컨볼루션을 통해 미세한 눈의 외형 세부 정보를 포착함으로써 눈의 방향 추정 정확도를 향상시킬 수 있는가?
  • RQ2눈의 방향을 주관적 독립적 성분과 주관적 의존적 성분으로 분리하면 개인 간 일반화 능력이 향상되는가?
  • RQ3정확도를 손상시키지 않고 단 한 장 또는 몇 장의 이미지만으로 校정을 크게 단순화할 수 있는가?
  • RQ4정확도와 校정 효율성 측면에서 기존 최신 기술 대비 제안된 방법은 어떻게 비교되는가?

주요 결과

  • 교정 없이도 GEDDnet는 최신 기술 수준의 방법보다 눈의 방향 추정 정확도에서 6.3% 이상 뛰어나다.
  • 제안된 교정 방법은 기준 방법 대비 추정 오차를 최대 35.6% 감소시킨다.
  • 이전 방법보다 훨씬 적은 교정 데이터를 요구하면서도 최신 기술 수준의 성능을 달성한다.
  • 교정 타겟 위치의 변동에 대해 강건성을 보이며 실용적 사용성을 향상시킨다.
  • 큰 머리 자세 및 얼굴 위치 변화가 있는 새로 수집한 데이터셋 포함하여 네 개의 데이터셋에서 수행된 실험을 통해 방법의 일반화 능력과 강건성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.