[논문 리뷰] Appearance-based Gaze Estimation With Deep Learning: A Review and Benchmark
딥 러닝을 활용한 외관 기반 시선 추정 방법의 포괄적 리뷰 및 벤치마크로, 특징 추출, 네트워크 설계, 보정 및 기기를 다루며 표준화된 평가 파이프라인을 제시한다.
Human gaze provides valuable information on human focus and intentions, making it a crucial area of research. Recently, deep learning has revolutionized appearance-based gaze estimation. However, due to the unique features of gaze estimation research, such as the unfair comparison between 2D gaze positions and 3D gaze vectors and the different pre-processing and post-processing methods, there is a lack of a definitive guideline for developing deep learning-based gaze estimation algorithms. In this paper, we present a systematic review of the appearance-based gaze estimation methods using deep learning. Firstly, we survey the existing gaze estimation algorithms along the typical gaze estimation pipeline: deep feature extraction, deep learning model design, personal calibration and platforms. Secondly, to fairly compare the performance of different approaches, we summarize the data pre-processing and post-processing methods, including face/eye detection, data rectification, 2D/3D gaze conversion and gaze origin conversion. Finally, we set up a comprehensive benchmark for deep learning-based gaze estimation. We characterize all the public datasets and provide the source code of typical gaze estimation algorithms. This paper serves not only as a reference to develop deep learning-based gaze estimation methods, but also a guideline for future gaze estimation research. The project web page can be found at https://phi-ai.buaa.edu.cn/Gazehub.
연구 동기 및 목표
- 눈(Eye), 얼굴(Face), 비디오를 포함한 입력 유형에 걸쳐 딥 러닝 기반의 외관 기반 시선 추정 방법을 조사한다.
- 네트워크 아키텍처와 감독 방식(감독 학습, 준/자기/비감독 학습, 다중 작업, 순환)을 분석한다.
- 데이터 전처리 및 후처리 단계와 이에 따른 성능 영향을 평가한다.
- 공개 코드와 데이터셋으로 통합된 시선 추정 벤치마크를 제공한다.
- 강건하고 교차 피험자(Cross-subject) 시선 추정을 위한 가이드라인과 향후 연구 방향을 제시한다.
제안 방법
- 특징 추출 리뷰를 위해 입력 특징을 눈 이미지, 얼굴 이미지, 비디오로 분류한다.
- CNN 아키텍처와 감독 전략(감독 학습, 준/자기/비감독 학습, 다중 작업, 순환)을 논의한다.
- 시선 추정을 위한 보정 방법 및 디바이스/플랫폼 고려사항을 설명한다.
- 벤치마크에 사용된 데이터 전처리/후처리 단계 및 시선 변환 방법을 요약한다.
- 공개 데이터셋을 수집하고 일반적인 시선 추정 코드를 재구현하여 공정한 비교를 위한 벤치마크를 구축하고 구현한다.
실험 결과
연구 질문
- RQ1주요 딥 러닝 접근법은 무엇이며 입력 유형과 아키텍처에서 어떻게 다른가?
- RQ2보정, 피험자 가변성, 기기/플랫폼 선택이 시선 추정 성능에 어떤 영향을 미치는가?
- RQ3데이터셋 간 공정한 비교를 위해 필요한 전처리 및 후처리 단계는 무엇인가?
- RQ4현행 공개 데이터셋과 기준 방법은 무엇이며, 통합 평가 프로토콜 하에서 어떻게 성능이 나타나는가?
주요 결과
- 딥 러닝 방법은 기존의 외관 기반 방법에 비해 머리 움직임 및 피험자 간 변동에 대한 강건성을 향상시킨다.
- 주의 집중 기반 융합(attention-based fusion)이나 비대칭 회귀를 가진 두 눈 입력을 사용하면 시선 추정 정확도가 향상될 수 있다.
- 교정, 데이터 확장, 피험자 불변 특징 학습은 교차 피험자 성능에 중요하다.
- 공개 데이터셋을 수집하고 일반적인 시선 추정 알고리즘을 재구현하여 공정한 비교를 가능하게 하는 벤치마크가 구축된다.
- 본 논문은 재현성을 위해 phi-ai.org/GazeHub에서 구현된 방법과 데이터 처리 코드를 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.