[논문 리뷰] Gaze Gestures and Their Applications in human-computer interaction with a head-mounted display
이 논문은 단일 RGB 카메라를 사용하여 헤드마운티드 디스플레이(HMD)에서 실시간 눈동자 추적을 위한 두 가지 딥러닝 모델인 UEGazeNet과 UEGazeNet*을 제안한다. 눈의 지점 검출 및 눈동자 경로 분류를 통해, 새로운 GTgestures 데이터셋(10,200개의 눈동자 그림 그리기 동작)에서 평균 96.71%의 인식 정확도를 달성하며, 다양한 조건에서 최신 기술 대비 52–67% 높은 정확도를 보인다.
A head-mounted display (HMD) is a portable and interactive display device. With the development of 5G technology, it may become a general-purpose computing platform in the future. Human-computer interaction (HCI) technology for HMDs has also been of significant interest in recent years. In addition to tracking gestures and speech, tracking human eyes as a means of interaction is highly effective. In this paper, we propose two UnityEyes-based convolutional neural network models, UEGazeNet and UEGazeNet*, which can be used for input images with low resolution and high resolution, respectively. These models can perform rapid interactions by classifying gaze trajectories (GTs), and a GTgestures dataset containing data for 10,200 "eye-painting gestures" collected from 15 individuals is established with our gaze-tracking method. We evaluated the performance both indoors and outdoors and the UEGazeNet can obtaine results 52\% and 67\% better than those of state-of-the-art networks. The generalizability of our GTgestures dataset using a variety of gaze-tracking models is evaluated, and an average recognition rate of 96.71\% is obtained by our method.
연구 동기 및 목표
- 저비용, 단일 RGB 카메라 설정을 사용하여 헤드마운티드 디스플레이(HMD)에서 강력하고 실시간 눈동자 상호작용을 가능하게 하기 위해.
- 고품질 입력, 대규모 데이터셋 또는 전용 하드웨어가 필요한 기존 눈동자 추적 방법의 한계를 해결하기 위해.
- 부정확한 추적 조건이나 사용자 운동이 발생하더라도 효과적으로 기능하는 눈동자 제스처 분류 시스템을 개발하기 위해.
- 눈동자 기반 HCI 시스템의 훈련 및 평가를 위해 다양하고 대규모의 눈동자 경로 데이터셋을 구축하기 위해.
제안 방법
- 눈동자 지점 검출 및 이를 바탕으로 눈동자 방향 추론을 수행하는 컨볼루션 신경망인 UEGazeNet을 제안하여, 부분적인 눈의 가림이나 극단적인 카메라 각도 조건에서도 강력한 추정이 가능하도록 한다.
- 전체 이미지 특징에 중점을 두어 저해상도 입력에 최적화된 UEGazeNet*이라는 UEGazeNet의 변종을 도입한다.
- UnityEyes를 활용해 합성 데이터를 생성하여 레이블링 비용을 절감하고, 극단적인 시야 각도를 포함한 데이터 증강을 가능하게 한다.
- 정확한 커서 제어에 의존하지 않고 눈동자 경로에서 사용자 의도를 탐지하기 위해 CNN 기반의 눈동자 제스처 분류기 도입.
- 무작위 패턴 변형을 적용하여 다양성과 현실감을 높인 15명의 참가자로부터 수집한 10,200개의 눈동자 경로로 구성된 GTgestures 데이터셋을 구축.
- 데이터 증강 및 실시간 추적을 적용하여, 사용자가 걷거나 빠른 눈동자 운동을 할 때와 같은 동적인 환경에서도 상호작용을 지원한다.
실험 결과
연구 질문
- RQ1전용 하드웨어나 고해상도 입력 없이도 단일 RGB 카메라로 HMD에서 정확하고 강력한 눈동자 추적을 달성할 수 있는가?
- RQ2눈동자 추적의 정확도가 떨어지거나 사용자가 움직일 경우에도 딥러닝 기반 눈동자 제스처 분류기가 사용자 의도를 인식하는 데 얼마나 효과적인가?
- RQ3UnityEyes에서 생성한 합성 데이터가 실제 환경 조건으로 일반화되는 데 얼마나 효과적으로 활용될 수 있는가?
- RQ4UEGazeNet의 지점 기반 접근 방식이 부분적인 눈 가림이나 극단적인 카메라 각도와 같은 도전적인 조건에서 눈동자 추정 성능을 어떻게 향상시키는가?
- RQ5제안된 시스템은 실내 및 실외를 포함한 제약 없는 환경에서 어떤 성능을 보이는가?
주요 결과
- UEGazeNet은 실내 및 실외 환경에서 각각 최신 기술 대비 52% 및 67% 높은 정확도를 기록하여 뛰어난 강건성을 입증한다.
- GTgestures 데이터셋은 17개의 눈동자 제스처 패턴에서 평균 96.71%의 인식률을 달성하여 제안된 방법의 높은 일반화 능력과 효과성을 확인한다.
- 사용자는 두 번째 시도에 첫 번째 시도(40–50분) 대비 훨씬 적은 시간(20–23분)으로 데이터 수집 작업을 완료하여 눈동자 제스처 상호작용에 신속하게 학습하고 적응하는 것으로 나타났다.
- 눈동자 제스처 분류기는 궤적의 변동성에 대해 내성적인 내성성을 지녀, 눈동자 추적이 정확하지 않거나 사용자가 움직일 경우에도 효과적인 상호작용을 가능하게 한다.
- UnityEyes를 통해 생성된 합성 데이터는 최소한의 실제 레이블링으로도 효과적인 훈련을 가능하게 하여 비용 절감과 극단적인 시야 각도 커버리지 향상에 기여한다.
- UEGazeNet*은 전체 이미지 특징을 활용하여 저해상도 입력을 효과적으로 처리하여 자원 제약이 있는 HMD 플랫폼에 적합하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.