Skip to main content
QUICK REVIEW

[논문 리뷰] LEyes: A Lightweight Framework for Deep Learning-Based Eye Tracking using Synthetic Eye Images

Sean Anthony Byrne, Virmarie Maquiling|arXiv (Cornell University)|2023. 09. 12.
Gaze Tracking and Assistive TechnologyComputer Science인용 수 3
한 줄 요약

LEyes는 깊이 학습 기반 눈 추적을 위한 경량이며 합성 데이터 생성 프레임워크로, 단지 필수적인 이미지 특징—동공 및 각막 반사(CR) 위치—을 간단한 조명 분포를 사용하여 모델링한다. 이는 신경망의 효율적 훈련을 가능하게 하여 동공 및 CR 국소화에서 최신 기술 수준의 성능을 달성하며, 저가 하드웨어에서 기존 방법과 상업적 눈 추적기조차도 능가한다.

ABSTRACT

Deep learning has bolstered gaze estimation techniques, but real-world deployment has been impeded by inadequate training datasets. This problem is exacerbated by both hardware-induced variations in eye images and inherent biological differences across the recorded participants, leading to both feature and pixel-level variance that hinders the generalizability of models trained on specific datasets. While synthetic datasets can be a solution, their creation is both time and resource-intensive. To address this problem, we present a framework called Light Eyes or "LEyes" which, unlike conventional photorealistic methods, only models key image features required for video-based eye tracking using simple light distributions. LEyes facilitates easy configuration for training neural networks across diverse gaze-estimation tasks. We demonstrate that models trained using LEyes are consistently on-par or outperform other state-of-the-art algorithms in terms of pupil and CR localization across well-known datasets. In addition, a LEyes trained model outperforms the industry standard eye tracker using significantly more cost-effective hardware. Going forward, we are confident that LEyes will revolutionize synthetic data generation for gaze estimation models, and lead to significant improvements of the next generation video-based eye trackers.

연구 동기 및 목표

  • 딥 러닝 기반 시선 추정에서 데이터 부족과 레이블링 부담 문제를 해결하기 위해 합성 눈 이미지를 생성한다.
  • 실제 눈 이미지의 하드웨어 및 생물학적 변형으로 인한 도메인 이탈 문제를 해결한다. 이는 모델의 일반화 능력을 제한한다.
  • 낮은 계산 자원을 사용하여 다양한 시선 추정 작업에 대해 깊이 학습 모델을 훈련시킬 수 있는 경량이며 구성 가능한 프레임워크를 개발한다.
  • 실세계 조건으로 일반화되는 합성 데이터를 기반으로 훈련시켜 저가 하드웨어에서도 고성능의 시선 추정을 가능하게 한다.
  • 사람의 눈 추적에 필요한 핵심 기능에 집중하여 포토리얼리스틱 합성 데이터 생성의 대안으로서 확장 가능하고 효율적인 방법을 제공한다.

제안 방법

  • 포토리얼리스틱 렲팅 대신 단순한 조명 분포를 사용하여 핵심 시각적 특징—동공 및 CR 위치—을 모델링한다.
  • 실제 눈 이미지 특징의 통계 분포(예: 동공 강도, CR 위치)를 기반으로 하는 파arameterized 생성기 정의.
  • 두 단계로 구성된 이미지 처리 파이프라인 적용: 첫 번째로 임계값 기반 분할을 통해 동공 및 CR 중심 국소화; 두 번째로 마스크된 컷아웃을 사용한 CNN 기반 정밀 조정.
  • CNN 추론 이전에 CR 컷아웃에는 검은 원형 마스크(48px 반경)를, 동공 컷아웃에는 회색 타원형 마스크(동공 타원 크기의 1.4배)를 적용한다.
  • LEyes가 생성한 합성 데이터로 신경망을 훈련시키고, 실제 데이터셋에서 RMS-S2S 정밀도 및 시선 정확도 지표를 사용해 성능을 평가한다.
  • 3×3 고정점 그리드 기반으로 2차 다항 모델과 1차 상호작용을 사용하여 시선 신호를 校정한다. 이는 정확도 향상에 기여한다.
Figure 1: A. Images from the four datasets we used to test the LEyes framework. B. The LEyes synthetic training sets corresponding to the real eye datasets in A. These images are based on the light distributions of the real eye datasets. C. This shows the predictions of the LEyes trained model on th
Figure 1: A. Images from the four datasets we used to test the LEyes framework. B. The LEyes synthetic training sets corresponding to the real eye datasets in A. These images are based on the light distributions of the real eye datasets. C. This shows the predictions of the LEyes trained model on th

실험 결과

연구 질문

  • RQ1최소한의 시각적 특징에 기반한 경량 합성 데이터 생성 프레임워크가 동공 및 CR 국소화에서 최신 기술 수준의 방법과 비교해 유사하거나 뛰어난 성능을 달성할 수 있는가?
  • RQ2LEyes에서 생성한 합성 데이터가 다양한 하드웨어 설정과 눈 이미지의 생물학적 변형 간에 얼마나 잘 일반화되는가?
  • RQ3저가 하드웨어에 배포된 경우, LEyes로 생성한 데이터로 훈련된 모델이 산업 표준 상업적 눈 추적기보다 뛰어난 성능을 보일 수 있는가?
  • RQ4실제 데이터셋으로 훈련된 모델에 비해 LEyes로 훈련된 모델의 시선 정확도 및 정밀도는 어떻게 비교되는가?
  • RQ5포괄적인 포토리얼리스틱 렌더링 대비 핵심 이미지 특징(동공 및 CR)만을 사용할 경우, 모델의 효율성과 일반화 능력에 어떤 영향을 미치는가?

주요 결과

  • LEyes가 생성한 합성 데이터로 훈련된 모델은 여러 벤치마크 데이터셋에서 동공 및 CR 국소화에서 최신 기술 수준의 성능을 달성한다.
  • LEyes로 훈련된 모델은 저가 하드웨어에서 산업 표준 EyeTracker를 능가하며, 더 뛰어난 일반화 능력과 강건성을 보여준다.
  • LEyes가 생성한 데이터는 다양한 기록 조건에서도 일관된 성능을 보이며, 하드웨어 및 생물학적 변형으로 인한 도메인 이탈을 감소시킨다.
  • 이 프레임워크는 RMS-S2S 정밀도 지표에서 기존 방법과 비교해 실눈 이미지 데이터에서 유사하거나 뛰어난 정확도를 달성한다.
  • 합성 데이터 생성 과정은 계산적으로 효율적이며, 최소한의 레이블링이 필요하여 데이터 수집 및 레이블링 비용을 크게 절감한다.
  • 간단한 조명 분포와 기능별 마스크 적용을 통해 복잡하고 자원을 많이 소비하는 포토리얼리스틱 렌더링 없이도 높은 모델 성능을 달성할 수 있다.
(A)
(A)

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.