[논문 리뷰] LEyes: A Lightweight Framework for Deep Learning-Based Eye Tracking using Synthetic Eye Images
LEyes는 깊이 학습 기반 눈 추적을 위한 경량이며 합성 데이터 생성 프레임워크로, 단지 필수적인 이미지 특징—동공 및 각막 반사(CR) 위치—을 간단한 조명 분포를 사용하여 모델링한다. 이는 신경망의 효율적 훈련을 가능하게 하여 동공 및 CR 국소화에서 최신 기술 수준의 성능을 달성하며, 저가 하드웨어에서 기존 방법과 상업적 눈 추적기조차도 능가한다.
Deep learning has bolstered gaze estimation techniques, but real-world deployment has been impeded by inadequate training datasets. This problem is exacerbated by both hardware-induced variations in eye images and inherent biological differences across the recorded participants, leading to both feature and pixel-level variance that hinders the generalizability of models trained on specific datasets. While synthetic datasets can be a solution, their creation is both time and resource-intensive. To address this problem, we present a framework called Light Eyes or "LEyes" which, unlike conventional photorealistic methods, only models key image features required for video-based eye tracking using simple light distributions. LEyes facilitates easy configuration for training neural networks across diverse gaze-estimation tasks. We demonstrate that models trained using LEyes are consistently on-par or outperform other state-of-the-art algorithms in terms of pupil and CR localization across well-known datasets. In addition, a LEyes trained model outperforms the industry standard eye tracker using significantly more cost-effective hardware. Going forward, we are confident that LEyes will revolutionize synthetic data generation for gaze estimation models, and lead to significant improvements of the next generation video-based eye trackers.
연구 동기 및 목표
- 딥 러닝 기반 시선 추정에서 데이터 부족과 레이블링 부담 문제를 해결하기 위해 합성 눈 이미지를 생성한다.
- 실제 눈 이미지의 하드웨어 및 생물학적 변형으로 인한 도메인 이탈 문제를 해결한다. 이는 모델의 일반화 능력을 제한한다.
- 낮은 계산 자원을 사용하여 다양한 시선 추정 작업에 대해 깊이 학습 모델을 훈련시킬 수 있는 경량이며 구성 가능한 프레임워크를 개발한다.
- 실세계 조건으로 일반화되는 합성 데이터를 기반으로 훈련시켜 저가 하드웨어에서도 고성능의 시선 추정을 가능하게 한다.
- 사람의 눈 추적에 필요한 핵심 기능에 집중하여 포토리얼리스틱 합성 데이터 생성의 대안으로서 확장 가능하고 효율적인 방법을 제공한다.
제안 방법
- 포토리얼리스틱 렲팅 대신 단순한 조명 분포를 사용하여 핵심 시각적 특징—동공 및 CR 위치—을 모델링한다.
- 실제 눈 이미지 특징의 통계 분포(예: 동공 강도, CR 위치)를 기반으로 하는 파arameterized 생성기 정의.
- 두 단계로 구성된 이미지 처리 파이프라인 적용: 첫 번째로 임계값 기반 분할을 통해 동공 및 CR 중심 국소화; 두 번째로 마스크된 컷아웃을 사용한 CNN 기반 정밀 조정.
- CNN 추론 이전에 CR 컷아웃에는 검은 원형 마스크(48px 반경)를, 동공 컷아웃에는 회색 타원형 마스크(동공 타원 크기의 1.4배)를 적용한다.
- LEyes가 생성한 합성 데이터로 신경망을 훈련시키고, 실제 데이터셋에서 RMS-S2S 정밀도 및 시선 정확도 지표를 사용해 성능을 평가한다.
- 3×3 고정점 그리드 기반으로 2차 다항 모델과 1차 상호작용을 사용하여 시선 신호를 校정한다. 이는 정확도 향상에 기여한다.

실험 결과
연구 질문
- RQ1최소한의 시각적 특징에 기반한 경량 합성 데이터 생성 프레임워크가 동공 및 CR 국소화에서 최신 기술 수준의 방법과 비교해 유사하거나 뛰어난 성능을 달성할 수 있는가?
- RQ2LEyes에서 생성한 합성 데이터가 다양한 하드웨어 설정과 눈 이미지의 생물학적 변형 간에 얼마나 잘 일반화되는가?
- RQ3저가 하드웨어에 배포된 경우, LEyes로 생성한 데이터로 훈련된 모델이 산업 표준 상업적 눈 추적기보다 뛰어난 성능을 보일 수 있는가?
- RQ4실제 데이터셋으로 훈련된 모델에 비해 LEyes로 훈련된 모델의 시선 정확도 및 정밀도는 어떻게 비교되는가?
- RQ5포괄적인 포토리얼리스틱 렌더링 대비 핵심 이미지 특징(동공 및 CR)만을 사용할 경우, 모델의 효율성과 일반화 능력에 어떤 영향을 미치는가?
주요 결과
- LEyes가 생성한 합성 데이터로 훈련된 모델은 여러 벤치마크 데이터셋에서 동공 및 CR 국소화에서 최신 기술 수준의 성능을 달성한다.
- LEyes로 훈련된 모델은 저가 하드웨어에서 산업 표준 EyeTracker를 능가하며, 더 뛰어난 일반화 능력과 강건성을 보여준다.
- LEyes가 생성한 데이터는 다양한 기록 조건에서도 일관된 성능을 보이며, 하드웨어 및 생물학적 변형으로 인한 도메인 이탈을 감소시킨다.
- 이 프레임워크는 RMS-S2S 정밀도 지표에서 기존 방법과 비교해 실눈 이미지 데이터에서 유사하거나 뛰어난 정확도를 달성한다.
- 합성 데이터 생성 과정은 계산적으로 효율적이며, 최소한의 레이블링이 필요하여 데이터 수집 및 레이블링 비용을 크게 절감한다.
- 간단한 조명 분포와 기능별 마스크 적용을 통해 복잡하고 자원을 많이 소비하는 포토리얼리스틱 렌더링 없이도 높은 모델 성능을 달성할 수 있다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.