Skip to main content
QUICK REVIEW

[논문 리뷰] Adaptive Feature Fusion Network for Gaze Tracking in Mobile Tablets

Yiwei Bao, Yihua Cheng|arXiv (Cornell University)|2021. 03. 20.
Gaze Tracking and Assistive Technology참고 문헌 41인용 수 4
한 줄 요약

이 논문은 모바일 태블릿을 위한 새로운 CNN 기반의 눈동자 추적 방법인 적응형 기능 융합 네트워크(AFF-Net)를 제안한다. 이 방법은 쌍렬 특징 맵과 압축-자극(SE) 층을 사용하여 좌우 눈 기능을 적응적으로 융합하고, 얼굴 외관을 활용하여 눈 기능을 재보정하는 적응형 그룹 정규화(AdaGN)를 적용한다. 이 방법은 GazeCapture 및 MPIIFaceGaze 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하며, 스마트폰 이미지에서는 1.62 cm, 태블릿 이미지에서는 2.30 cm의 유클리드 거리 오차를 기록한다.

ABSTRACT

Recently, many multi-stream gaze estimation methods have been proposed. They estimate gaze from eye and face appearances and achieve reasonable accuracy. However, most of the methods simply concatenate the features extracted from eye and face appearance. The feature fusion process has been ignored. In this paper, we propose a novel Adaptive Feature Fusion Network (AFF-Net), which performs gaze tracking task in mobile tablets. We stack two-eye feature maps and utilize Squeeze-and-Excitation layers to adaptively fuse two-eye features according to their similarity on appearance. Meanwhile, we also propose Adaptive Group Normalization to recalibrate eye features with the guidance of facial feature. Extensive experiments on both GazeCapture and MPIIFaceGaze datasets demonstrate consistently superior performance of the proposed method.

연구 동기 및 목표

  • 좌우 눈 간 구조적 유사성을 활용하여 모바일 태블릿에서의 눈동자 추정 정확도를 향상시키기 위해.
  • 간단한 기능 벡터 연결의 한계를 해결하기 위해 특징 맵의 구조를 유지하는 공간 인식 융합 메커니즘을 도입하기 위해.
  • 적응 정규화를 통해 얼굴 외관 특징(예: 헤드 포즈, 조명, 신원 등)을 통합하여 눈 기능 추출을 향상시키기 위해.
  • 비구속 환경에서 강력한 눈동자 추정을 위해 눈과 얼굴 기능 활용을 통합 최적화하는 통합 프레임워크를 개발하기 위해.

제안 방법

  • 좌우 눈의 특징 맵을 네트워크의 다양한 레이어에서 스택하여 공간적 관계를 유지하고 더 효과적인 융합을 가능하게 한다.
  • 스택 후 Squeeze-and-Excitation(SE) 레이어를 적용하여 눈 간 외관 유사성에 기반해 채널별 기능 중요도를 적응적으로 재보정한다.
  • 새로운 적응형 그룹 정규화(AdaGN) 레이어를 도입하여 얼굴 및 눈 경계 상자와 얼굴 특징을 사용해 눈 기능 재보정을 위한 스케일 및 시프트 파라미터를 동적으로 계산한다.
  • 눈과 얼굴 입력을 종단 간(end-to-end)으로 처리하며, 얼굴 스트림이 눈 기능 표현을 정밀하게 보완하는 맥락적 가이던스를 제공한다.
  • 최종 눈동자 예측은 융합된 눈 기능에서 유도되며, 모델은 실제 모바일 태블릿 이미지에서 2차원 눈동자 위치 오차를 최소화하도록 훈련된다.
  • 아키텍처는 두 개의 대규모 데이터셋에서 평가된다: GazeCapture(스마트폰 및 태블릿 기반)와 MPIIFaceGaze(노트북 기반).

실험 결과

연구 질문

  • RQ1기능 벡터의 연결 대신 눈 기능 맵을 스택함으로써 공간적 구조를 유지함으로써 눈동자 추정 정확도 향상이 가능한가?
  • RQ2압축-자극(SE) 레이어를 통한 적응적 채널별 가중치 부여가 눈 간 외관 유사성을 모델링함으로써 성능 향상에 기여하는가?
  • RQ3얼굴 외관 특징(예: 헤드 포즈, 조명, 신원 등)을 적응 정규화를 통해 눈 기능 학습을 안내하는 데 효과적으로 활용될 수 있는가?
  • RQ4작은 얼굴 크기 또는 다양한 눈동자 방향 조건과 같은 극한 조건에서 제안된 융합 및 가이던스 메커니즘의 성능은 어떠한가?

주요 결과

  • AFF-Net은 GazeCapture 데이터셋의 스마트폰 이미지에서 1.62 cm, 태블릿 이미지에서 2.30 cm의 유클리드 거리 오차를 기록하며 최신 기술 수준(SOTA) 방법을 초월한다.
  • MPIIFaceGaze 데이터셋에서 3.9 cm의 유클리드 거리 오차와 3D 눈동자 방향 추정 시 4.4도의 각도 오차를 기록하여 랩탑 기반 환경으로의 일반화 능력이 뛰어나다는 것을 입증한다.
  • 절단 실험 결과에서 스택, SE 레이어 또는 AdaGN를 제거할 경우 오차가 약 4% 증가함을 확인하여 각 모듈의 기여도를 입증한다.
  • 히트맵 분석 결과 AFF-Net은 모든 눈동자 위치에서 낮은 오차를 유지하며, 특히 카메라 가장자리 근처에서 뛰어난 강건성을 보임을 확인한다.
  • 작은 얼굴 크기 조건에서도 기준 모델 대비 유의미하게 낮은 오차를 기록하여 극단적인 경우에도 뛰어난 일반화 성능을 보임을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.