Skip to main content
QUICK REVIEW

[논문 리뷰] MagicEyes: A Large Scale Eye Gaze Estimation Dataset for Mixed Reality

Zhengyang Wu, Srivignesh Rajendran|arXiv (Cornell University)|2020. 03. 18.
Gaze Tracking and Assistive Technology참고 문헌 37인용 수 4
한 줄 요약

이 논문은 실제 혼합현실 장치를 사용하여 수집한 대규모 눈의 시선 추정 데이터셋인 MagicEyes를 소개한다. 이 데이터셋은 587명의 참가자, 80,000장의 인간 레이블이 부여된 이미지, 800,000개 이상의 시선 대상 레이블을 포함한다. 또한 단일 순방향 전파에서 각막 중심, 반사광, 동공, 눈 분할을 동시에 추정하는 다중 작업 딥러닝 모델인 EyeNet을 제안하며, 전통적인 히ュ리스틱 기반 파이프라인에 비해 더 뛰어난 내성과 효율성을 입증한다. 특히 비축점 눈 이미지에서 성능이 향상된다.

ABSTRACT

With the emergence of Virtual and Mixed Reality (XR) devices, eye tracking has received significant attention in the computer vision community. Eye gaze estimation is a crucial component in XR -- enabling energy efficient rendering, multi-focal displays, and effective interaction with content. In head-mounted XR devices, the eyes are imaged off-axis to avoid blocking the field of view. This leads to increased challenges in inferring eye related quantities and simultaneously provides an opportunity to develop accurate and robust learning based approaches. To this end, we present MagicEyes, the first large scale eye dataset collected using real MR devices with comprehensive ground truth labeling. MagicEyes includes $587$ subjects with $80,000$ images of human-labeled ground truth and over $800,000$ images with gaze target labels. We evaluate several state-of-the-art methods on MagicEyes and also propose a new multi-task EyeNet model designed for detecting the cornea, glints and pupil along with eye segmentation in a single forward pass.

연구 동기 및 목표

  • 혼합현실(MR) 기기에서 비축점 눈 시선 추정을 위한 대규모 실세계 데이터셋의 부족을 해결하기 위해.
  • 풍부한 레이블이 부여된 실기기에서 수집한 종합적인 데이터셋을 기반으로 최신 기법들을 평가하기 위해.
  • 동공, 반사광, 각막, 분할 등 핵심 눈 특징을 동시에 추정하는 통합된 딥러닝 프레임워크를 개발하여 내성과 효율성을 향상시키기 위해.
  • 하이브리드 기하학적 및 히ュ리스틱 기반 접근 방식을 능가하는 엔드 투 엔드 학습 기반의 시선 추정을 실세계 환경에서 가능하게 하기 위해.

제안 방법

  • MagicEyes 데이터셋은 실제 MR 기기를 사용하여 수집되었으며, 다양한 조명 및 인구 통계 조건에서 587명의 참가자로부터 640×480 인프라레드(IR) 눈 이미지를 촬영하였다.
  • 이 데이터셋에는 눈 부위 분할(얼굴, 흰자, 동공, 동공)에 대한 인간 검증 기준값이 부여된 80,000장의 이미지와 800,000개 이상의 시선 대상 레이블이 포함되어 있다.
  • EyeNet은 공유된 ResNet-50 + FPN 인코더와 눈 분할, 동공 및 반사광 위치 추정, 각막 중심 추정을 위한 네 개의 작업별 디코더를 갖춘 다중 작업 딥 네트워크이다.
  • 모델은 단일 순방향 전파를 통해 다중 출력을 예측하며, 공유된 특징을 활용하여 일반화 능력을 향상시키고 계산 비용을 감소시킨다.
  • 네트워크는 지도 학습과 기하학적 제약 조건을 통합하며, 가분성 있는 3차원 눈 모델을 사용해 2차원 예측에서 시선 추정을 정밀하게 보정한다.
  • 평가에는 아블레이션 스터디와 RlTNet 및 NVGaze와 같은 최신 기법들과의 비교 분석이 포함되어 있으며, 분할, 동공 위치 추정, 시선 추정 작업에서 수행된다.

실험 결과

연구 질문

  • RQ1실제 혼합현실 기기에서 수집한 대규모 실세계 데이터셋에서 최신 기술의 눈 시선 추정 방법은 어떤 성능을 보이는가?
  • RQ2다중 작업 딥러닝 모델이 별도 또는 히ュ리스틱 기반 파이프라인보다 눈 특징(동공, 반사광, 각막 중심, 분할)을 동시에 추정하는 데 더 강력한가?
  • RQ3기하학적 사전 지식을 통합한 엔드 투 엔드 학습이 비축점, 실세계 눈 영상 조건에서 시선 추정 정확도를 얼마나 향상시키는가?
  • RQ4현재의 엔드 투 엔드 딥러닝 접근 방식은 하이브리드 기하학적 방법에 비해 어떤 한계를 지니는가?

주요 결과

  • MagicEyes는 실제 MR 기기로 수집된 가장 큰 공개된 눈 시선 추정 데이터셋으로, 587명의 참가자와 800,000개 이상의 시선 대상 레이블을 포함한다.
  • 완전 컨볼루션 네트워크는 눈 분할과 동공 위치 추정에서 뛰어난 성능을 보였으며, 실세계 환경에서 기하학적 방법의 잠재력을 시사한다.
  • NVGaze와 같은 직접적인 엔드 투 엔드 딥러닝 방법은 이상적인 조건에서는 뛰어난 성능을 보였지만, 실세계 적용에는 높은 변동성을 보이며 부적합한 것으로 나타났다.
  • 제안된 EyeNet 모델은 각막 중심, 반사광, 동공, 분할을 동시에 추정함으로써 수동으로 설정한 히ュ리스틱에 대한 의존도를 감소시키며 베이스라인 방법을 초월하는 성능을 보였다.
  • 학습 과정에 기하학적 제약 조건을 통합함으로써 시선 추정의 내성과 정확도가 향상되었으며, 특히 도전적인 비축점 시야 조건에서 두드러진다.
  • 공유된 표현을 활용한 다중 작업 학습은 단일 추론 단계에서 여러 눈 관련 양상을 더 효율적이고 정확하게 추정할 수 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.