[논문 리뷰] GEDDnet: A Network for Gaze Estimation with Dilation and Decomposition
GEDDnet는 확장된 컨volution을 사용하여 미세한 눈의 외형 변화를 포착하고, 주관적 독립적 눈의 방향 예측과 주관적 의존적 편향을 분리하는 눈의 분해 방법을 활용한 새로운 딥러닝 프레임워크를 제안한다. 단 한 장 또는 몇 장의 타겟 이미지로 최소한의 校정을 통해 최신 기술 수준의 정확도를 달성하며, 오차를 최대 35.6% 감소시키고 校정 없이도 이전 방법보다 6.3% 이상 뛰어난 성능을 내며 승리한다.
Appearance-based gaze estimation from RGB images provides relatively unconstrained gaze tracking from commonly available hardware. The accuracy of subject-independent models is limited partly by small intra-subject and large inter-subject variations in appearance, and partly by a latent subject-dependent bias. To improve estimation accuracy, we propose to use dilated-convolutions in a deep convolutional neural network to capture subtle changes in the eye images, and a novel gaze decomposition method that decomposes the gaze angle into the sum of a subject-independent gaze estimate from the image and a subject-dependent bias. To further reduce estimation error, we propose a calibration method that estimates the bias from a few images taken as the subject gazes at only a few or even just a single gaze target. This significantly redues calibration time and complexity. Experiments on four datasets, including a new dataset we collected containing large variations in head pose and face location, indicate that even without calibration the estimator already outperforms state-of-the-art methods by more than 6.3%. The proposed calibration method is robust to the location of calibration target and reduces estimation error significantly (up to 35.6%), achieving state-of-the-art performance with much less calibration data than required by previously proposed methods.
연구 동기 및 목표
- RGB 기반 눈의 방향 추정에서 큰 개인 간 차이와 작은 개인 내 차이를 해결하기 위한 도전에 대응한다.
- 개인별 의존적 편향을 단 한 장 또는 몇 장의 눈의 목표 이미지에서 추정함으로써 校정 시간과 복잡성을 줄인다.
- 개인별 독립적 및 개인별 의존적 구성요소의 합으로 눈의 방향을 모델링함으로써 추정 정확도를 향상시킨다.
- 기존 방법보다 훨씬 적은 校정 데이터로 최신 기술 수준의 성능을 달성한다.
제안 방법
- 다양한 머리 자세와 얼굴 외형에서 눈 이미지의 미세한 공간적 변동을 포착하기 위해 깊이 신경망에 확장된 컨볼루션을 적용한다.
- 이미지 특징에서 유도된 주관적 독립적 성분과 주관적 의존적 편향으로 눈의 각도를 분리하는 눈의 분해 기법을 도입한다.
- 시험 대상이 목표를 향해 바라보는 단 한 장 또는 몇 장의 校정 이미지를 사용하여 주관적 의존적 편향을 추정하는 校정 방법을 설계한다.
- 예측된 눈의 방향 각도와 진짜 눈의 방향 각도 간 오차를 최소화하는 손실 함수를 사용하여 네트워크를 종합적으로 학습시킨다.
- 일반화 능력과 강건성을 평가하기 위해 큰 머리 자세 및 얼굴 위치 변화를 포함한 새로운 데이터셋을 사용한다.
실험 결과
연구 질문
- RQ1확장된 컨볼루션을 통해 미세한 눈의 외형 세부 정보를 포착함으로써 눈의 방향 추정 정확도를 향상시킬 수 있는가?
- RQ2눈의 방향을 주관적 독립적 성분과 주관적 의존적 성분으로 분리하면 개인 간 일반화 능력이 향상되는가?
- RQ3정확도를 손상시키지 않고 단 한 장 또는 몇 장의 이미지만으로 校정을 크게 단순화할 수 있는가?
- RQ4정확도와 校정 효율성 측면에서 기존 최신 기술 대비 제안된 방법은 어떻게 비교되는가?
주요 결과
- 교정 없이도 GEDDnet는 최신 기술 수준의 방법보다 눈의 방향 추정 정확도에서 6.3% 이상 뛰어나다.
- 제안된 교정 방법은 기준 방법 대비 추정 오차를 최대 35.6% 감소시킨다.
- 이전 방법보다 훨씬 적은 교정 데이터를 요구하면서도 최신 기술 수준의 성능을 달성한다.
- 교정 타겟 위치의 변동에 대해 강건성을 보이며 실용적 사용성을 향상시킨다.
- 큰 머리 자세 및 얼굴 위치 변화가 있는 새로 수집한 데이터셋 포함하여 네 개의 데이터셋에서 수행된 실험을 통해 방법의 일반화 능력과 강건성을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.