Skip to main content
QUICK REVIEW

[논문 리뷰] Gaze Estimation with an Ensemble of Four Architectures

Xin Cai, Boyu Chen|arXiv (Cornell University)|2021. 07. 05.
Gaze Tracking and Assistive Technology참고 문헌 23인용 수 12
한 줄 요약

이 논문은 ETH-XGaze 데이터셋에서 훈련된 네 가지 다채널 딥 러닝 아키텍처—iTracker-MHSA, BoTNet, HRNet, ResNeSt—를 사용한 앙상블 눈 향 추정 방법을 제안한다. 여섯 개의 최고 성능 모델 예측을 가중 선형 평균화하여 조합함으로써, 상태의 기준 평균 각도 오차 3.11°를 달성하여 ETH-XGaze 랭킹에서 1위를 기록한다.

ABSTRACT

This paper presents a method for gaze estimation according to face images. We train several gaze estimators adopting four different network architectures, including an architecture designed for gaze estimation (i.e.,iTracker-MHSA) and three originally designed for general computer vision tasks(i.e., BoTNet, HRNet, ResNeSt). Then, we select the best six estimators and ensemble their predictions through a linear combination. The method ranks the first on the leader-board of ETH-XGaze Competition, achieving an average angular error of $3.11^{\circ}$ on the ETH-XGaze test set.

연구 동기 및 목표

  • 극단적인 눈 향 각도, 머리 자세 변화 및 가림 현상 등 도전적인 실생활 조건에서의 눈 향 추정 정확도 향상.
  • 최신 눈 향 추정 방법 간 비교를 위한 통합 평가 지표 부족 문제 해결.
  • 단일 모델 접근 방식의 한계를 극복하기 위해 다양한 네트워크 아키텍처와 앙상블 학습 활용.
  • 다중 척도, 분할 주의, 확장 컨볼루션 기법이 눈 향 추정에 미치는 기여 확인.
  • 대규모 고해상도 ETH-XGaze 기준 데이터셋에서 뛰어난 성능 달성.

제안 방법

  • iTracker-MHSA(다중 헤드 자기주의 포함), BoTNet(버티컬 트랜스포머), HRNet(다중 척도 특징 추출), ResNeSt(다중 경로 및 채널 주의 포함) 등 네 가지 다른 딥 러닝 아키텍처 훈련.
  • iTracker-MHSA의 눈 브랜치에서 확장 컨볼루션을 적용하여 수용 영역 및 특징 표현 향상.
  • 얼굴과 눈 특징 간 다중 모odal 주의를 학습하기 위해 잔차 연결과 레이어 정규화를 갖춘 트랜스포머 인코더 통합.
  • 얼굴 랜드마크 검출(HRNet-W18)과 RoI Align을 사용해 얼굴 이미지에서 눈 영역 정확하게 자르기.
  • 각 배치의 상위 30% 손실 샘플을 가중치를 높여 온라인 하드 예외 마이닝을 적용하여 어려운 케이스에 대한 강건성 향상.
  • 전체 각도 오차를 최소화하기 위해 학습된 선형 가중치를 사용해 여섯 개의 최고 성능 모델 예측 앙상블.

실험 결과

연구 질문

  • RQ1다양한 딥 러닝 아키텍처를 조합함으로써 단일 모델 성능을 넘어서 눈 향 추정 정확도 향상을 이룰 수 있는가?
  • RQ2주목적 메커니즘(예: 다중 헤드 자기주의)과 다중 척도 특징 학습이 복잡한 실생활 환경에서 눈 향 추정에 어떤 영향을 미치는가?
  • RQ3확장 컨볼루션과 잔차 연결이 극단적인 머리 자세 및 조명 변화 조건에서 눈 향 추정 성능 향상에 기여하는 정도는?
  • RQ4다른 입력 해상도 및 아키텍처로 훈련된 모델의 가중 평균화된 앙상블 학습이 개별 모델보다 더 우수한 일반화 성능을 보이는가?
  • RQ5채널별 주의(ResNeSt) 및 다중 해상도 특징 융합(HRNet)과 같은 아키텍처 혁신이 ETH-XGaze 벤치마크에서 눈 향 추정 성능 향상에 얼마나 기여하는가?

주요 결과

  • 앙상블 모델은 ETH-XGaze 테스트 세트에서 평균 각도 오차 3.11°를 기록하여 공식 랭킹에서 1위를 달성.
  • 가장 우수한 단일 모델인 640×640 입력 크기의 HRNet는 3.22° 오차를 기록하여 더 큰 입력 해상도의 이점을 입증.
  • 448×448 입력을 사용한 iTracker-MHSA는 3.37° 오차를 기록하여 기준 iTracker(4.02°) 및 확장 컨볼루션을 적용한 iTracker(3.80°)보다 향상된 성능 보여.
  • 여섯 개 모델의 앙상블(Table 3)이 가장 우수한 단일 모델을 능가하여 학습된 가중치를 사용한 모델 평균화의 효과를 확인.
  • 여러 해상도로 훈련된 HRNet 모델(640, 768, 896)은 일관된 성능 보이며, 640×640에서 가장 낮은 오차(3.22°) 기록.
  • 448×448 입력을 사용한 ResNeSt는 3.34° 오차를 기록하여 다중 경로 및 채널 주의 메커니즘의 뛰어난 성능을 시사.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.