Skip to main content
QUICK REVIEW

[논문 리뷰] EyeNet: A Multi-Task Network for Off-Axis Eye Gaze Estimation and User Understanding

Zhengyang Wu, Srivignesh Rajendran|arXiv (Cornell University)|2019. 08. 24.
Gaze Tracking and Assistive Technology참고 문헌 35인용 수 9
한 줄 요약

EyeNet은 VR/MR 시스템에서 이방향 눈 이미지로부터 눈의 시선, 분할, 깜빡임 감지, 정서적 표정, 반사광 위치를 동시에 추정하는 다중 작업 딥 뉴럴 네트워크이다. 작업 간 공유된 특징과 수동으로 레이블링된 데이터 및 모델 기반의 지도 학습을 통해 12ms의 추론 시간으로 최신 기술 수준의 정확도를 달성하며, 수동으로 설계된 기하학적 파이프라인의 필요성을 제거한다.

ABSTRACT

Eye gaze estimation and simultaneous semantic understanding of a user through eye images is a crucial component in Virtual and Mixed Reality; enabling energy efficient rendering, multi-focal displays and effective interaction with 3D content. In head-mounted VR/MR devices the eyes are imaged off-axis to avoid blocking the user's gaze, this view-point makes drawing eye related inferences very challenging. In this work, we present EyeNet, the first single deep neural network which solves multiple heterogeneous tasks related to eye gaze estimation and semantic user understanding for an off-axis camera setting. The tasks include eye segmentation, blink detection, emotive expression classification, IR LED glints detection, pupil and cornea center estimation. To train EyeNet end-to-end we employ both hand labelled supervision and model based supervision. We benchmark all tasks on MagicEyes, a large and new dataset of 587 subjects with varying morphology, gender, skin-color, make-up and imaging conditions.

연구 동기 및 목표

  • 이방향 헤드셋 디스플레이에서 동시에 눈 시선 추정과 의미적 사용자 이해를 위한 통합된 딥 러닝 프레임워크를 개발하는 것.
  • 반사광과 동공 검출을 위한 수동으로 설계된 컴퓨터 비전 파이프라인에 의존하지 않고, 엔드 투 엔드 표현을 학습함으로써 이를 제거하는 것.
  • 이종 작업 간 공유된 특징 학습을 통해 자원 제약이 있는 AR/MR 환경에서의 강건성과 효율성을 향상시키는 것.
  • 성별, 피부 색소, 촬영 조건의 다양성을 포함한 대규모이고 다양한 데이터셋에서 성능을 벤치마킹하는 것.
  • 단일이고 계산적으로 효율적인 네트워크를 통해 눈 시선, 깜빡임, 표정, 눈 해부학을 정확하고 실시간으로 추정할 수 있도록 하는 것.

제안 방법

  • EyeNet은 ResNet50 기반의 다중 작업 학습 아키텍처를 사용하여 눈 분할, 깜빡임 감지, 정서적 표정 분류, 적외선 반사광 감지, 동공/결막 중심 추정을 동시에 최적화한다.
  • 네트워크는 눈의 기하학적 특징에서 유도된 모델 기반 지도 학습과 수동으로 레이블링된 지도 학습을 모두 사용하여, 결막 중심 및 시선 추정 정확도를 향상시킨다.
  • 공유된 백본 네트워크가 특징을 추출한 후, 여러 출력을 예측하기 위해 분기 구조를 사용하여 파rameter 공유와 계산 효율성을 달성한다.
  • 모델은 다양한 형태, 성별, 피부 색소, 촬영 조건을 가진 587명의 참가자가 포함된 새로운 데이터셋인 MagicEyes에서 엔드 투 엔드로 훈련된다.
  • 후처리 단계에서는 네트워크에서 제공한 초기 추정치를 기반으로 표준 경사 하강 최적화를 사용하여 3차원 시선 추정을 정밀하게 조정한다.
  • 160x120 입력 해상도와 ResNet50를 사용하여 추론 속도를 최적화함으로써 AR/MR 하드웨어에의 배포를 가능하게 한다.

실험 결과

연구 질문

  • RQ1단일 딥 뉴럴 네트워크가 이방향 눈 시선 추정 및 사용자 이해에서 다양한 이질적 작업을 효과적으로 해결할 수 있는가?
  • RQ2외관 기반 작업과 기하학적 작업 간의 공유된 표현 학습이 시선 추정의 강건성과 정확도를 향상시키는가?
  • RQ3눈의 기하학적 특징에서 파생된 모델 기반 지도 학습이 수동으로 설계된 히우리스틱이 없이도 시선 추정 정확도를 향상시킬 수 있는가?
  • RQ4오직 눈 영역 데이터만을 사용할 때, 다중 작업 학습이 깜빡임 감지 및 정서적 표정 분류 성능에 어떤 영향을 미치는가?
  • RQ5통합된 네트워크가 실시간 AR/MR 응용 프로그램에서 높은 정확도를 유지하면서 계산 부하를 얼마나 줄일 수 있는가?

주요 결과

  • 25명의 테스트 세트에서 EyeNet은 깜빡임 감지에 대해 1.24%의 거짓 양성률과 4.01%의 거짓 음성률을 기록하여 이전 연구(각각 8.3% 및 16.7%)를 초월한다.
  • 정서적 표정 분류는 총 정확도 92.75%를 달성했으며, 중립 클래스의 정확도는 94.92%, 기쁨 클래스는 93.74%였다.
  • GPU에서 EyeNet은 83fps(평균 12ms의 추론 시간)로 실행되어 AR/MR 기기에서 실시간 배포에 적합하다.
  • 모델 기반 지도 학습의 사용은 고품질의 결막 중심 예측을 가능하게 하여 시선 추정 정확도를 크게 향상시켰다.
  • 다중 작업 아키텍처는 수동으로 설계된 구성 요소의 필요성을 줄여 유지보수성과 확장성 향상에 기여한다.
  • MagicEyes 데이터셋에서 검증된 바와 같이, 모델은 성별, 피부 색소, 메이크업의 다양성에 걸쳐 강력한 일반화 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.