Skip to main content
QUICK REVIEW

[논문 리뷰] OpenEDS2020: Open Eyes Dataset

Cristina Palmero, Abhishek Sharma|arXiv (Cornell University)|2020. 05. 08.
Gaze Tracking and Assistive Technology참고 문헌 25인용 수 5
한 줄 요약

OpenEDS2020는 VR 환경에서 이중 동기화 눈추적 카메라를 통해 촬영한 고해상도(640×400), 100 Hz 눈영상 시퀀스로 구성된 대규모 익명화 데이터셋이다. 이는 시공간적 시선 예측 및 눈 분할 연구를 가능하게 하며, 시선 예측에서 평균 각도 오차 5.37°와 의미 분할에서 mIoU 84.1%를 달성하여 실시간 VR 응용 분야의 기준 데이터셋으로 기능한다.

ABSTRACT

We present the second edition of OpenEDS dataset, OpenEDS2020, a novel dataset of eye-image sequences captured at a frame rate of 100 Hz under controlled illumination, using a virtual-reality head-mounted display mounted with two synchronized eye-facing cameras. The dataset, which is anonymized to remove any personally identifiable information on participants, consists of 80 participants of varied appearance performing several gaze-elicited tasks, and is divided in two subsets: 1) Gaze Prediction Dataset, with up to 66,560 sequences containing 550,400 eye-images and respective gaze vectors, created to foster research in spatio-temporal gaze estimation and prediction approaches; and 2) Eye Segmentation Dataset, consisting of 200 sequences sampled at 5 Hz, with up to 29,500 images, of which 5% contain a semantic segmentation label, devised to encourage the use of temporal information to propagate labels to contiguous frames. Baseline experiments have been evaluated on OpenEDS2020, one for each task, with average angular error of 5.37 degrees when performing gaze prediction on 1 to 5 frames into the future, and a mean intersection over union score of 84.1% for semantic segmentation. As its predecessor, OpenEDS dataset, we anticipate that this new dataset will continue creating opportunities to researchers in eye tracking, machine learning and computer vision communities, to advance the state of the art for virtual reality applications. The dataset is available for download upon request at http://research.fb.com/programs/openeds-2020-challenge/.

연구 동기 및 목표

  • 실시간 VR/AR 응용 분야에 적합한 고해상도, 시간적으로 밀도 높고 익명화된 눈추적 데이터셋의 부족을 보완하기 위해.
  • 특히 포화 렌더링의 지연을 보완하기 위한 시공간적 시선 추정 및 예측 연구를 가능하게 하기 위해.
  • 시간적 일관성과 희소 레이블을 활용한 강력한 눈 분할 모델 개발을 지원하기 위해.
  • 침몰 기술 분야의 컴퓨터 비전, 머신러닝 및 눈추적 기술의 최신 기술 수준을 향한 발전을 이끄는 기준 데이터셋을 제공하기 위해.
  • 통제된 조명 조건과 다양한 참가자 인구 통계를 갖춘 공개 가능하고 개인정보 보호 기반 데이터셋을 통해 재현 가능한 연구를 촉진하기 위해.

제안 방법

  • 데이터셋은 100 Hz로 동기화된 두 대의 눈을 향한 카메라를 탑재한 VR HMD를 사용해 수집되었으며, 80명의 참가자가 시선 유도 작업을 수행함.
  • 시선 예측 데이터셋은 최대 66,560개의 시퀀스를 포함하며, 550,400장의 눈 이미지와 해당하는 3차원 시선 벡터를 포함해 시간 모델링을 가능하게 함.
  • 눈 분할 데이터셋은 5 Hz로 샘플링된 200개의 시퀀스로 구성되며, 프레임의 5%에만 밀도 있는 의미 분할 마스크(결막, 동공, 피부, 배경 포함)가 제공됨.
  • 3D 시선 예측 기준 모델은 32개 유닛의 완전 연결층과 2개 유닛의 선형 회귀 헤드를 갖춘 CNN을 사용하며, 클래스 불균형을 보완하기 위해 데이터 가중치를 적용해 전체 데이터의 75%로 학습함.
  • 시선 예측에는 50프레임 슬라이딩 윈도우를 사용해 향후 5프레임을 예측하기 위한 선형 회귀 파rameter를 계산함.
  • 의미 분할 기준 모델은 깊이 분리 가능 컨벌루션과 곱셉형 스킵 연결을 갖춘 경량 인코더-디코더 CNN을 사용하며, 1,605장의 레이블링된 이미지로 학습함.

실험 결과

연구 질문

  • RQ1단순한 선형 회귀 모델이 과거 50프레임의 시선 추정치만을 사용해 향후 시선 위치를 효과적으로 예측할 수 있는가?
  • RQ2특히 빠른 눈동자 운동(saccades) 동안 시선 예측 성능은 시간이 지남에 따라 어떻게 저하되는가?
  • RQ3희소 레이블링만 제공되고 시간 정보를 활용하지 않는 조건에서, 시간 정보가 눈 이미지의 의미 분할 정확도 향상에 얼마나 기여하는가?
  • RQ4희소 레이블링 조건에서 저비용 계산량을 유지하면서도 높은 분할 정확도(mIoU)를 달성할 수 있는 경량 딥러닝 모델은 가능한가?
  • RQ5눈 분할 및 시선 추정의 정확도가 포화 렌더링과 같은 후속 VR 응용 분야의 성능에 어떻게 영향을 미치는가?

주요 결과

  • 시선 예측 기준 모델은 향후 50ms의 시선 예측에서 평균 각도 오차 5.37도를 기록했으며, 시간이 지남에 따라 오차가 점차 증가함.
  • 시선 예측의 p95 오차는 12.48도에 도달하여 선형 모델이 빠른 눈동자 운동을 예측하는 데 상당한 과제를 안고 있음을 시사함.
  • 희소 레이블링과 시간 모델링 없이도 의미 분할 기준 모델은 테스트 세트에서 평균 교차율(mIoU) 점수 84.1%를 달성함.
  • 배경에 대해선 97.1% mIoU, 결막에 대해선 67.4%, 동공에 대해선 88.2%, 피부에 대해선 83.5%를 기록해 대부분의 구조에서 뛰어난 성능을 보임.
  • 학습된 시선 추정 네트워크는 검증 세트에서 평균 오차 4.58도를 기록했으며, 최신 주제 독립형 방법과 일치함.
  • 이 데이터셋은 고시간 해상도(100 Hz)와 통제된 환경 덕분에 빠른 눈동자 운동(saccades)을 정확히 모델링할 수 있으며, 이는 실시간 VR 시스템에 핵심적임.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.