[논문 리뷰] Towards Self-Supervised Gaze Estimation
이 논문은 기하학적 변환(예: 회전, 반전)에 대해 동치성(equivariance)을 강제하는 새로운 자기지도 학습 방법인 SwAT을 제안한다. 이는 SwAV 클러스터링 기반 접근법을 확장하여 gaze 추정에 적용한다. 대규모 데이터셋인 VGG-Face에서 정제되지 않은 얼굴 이미지를 사용하여, 교차 데이터셋 평가에서 감독 기반 기준 모델보다 최대 57% 향상되고, ETH-XGaze, Gaze360, MPIIFaceGaze에서 내부 데이터셋 벤치마크에서 최대 25% 향상되는 최신 기술 수준(SOTA) 성능을 달성한다.
Recent joint embedding-based self-supervised methods have surpassed standard supervised approaches on various image recognition tasks such as image classification. These self-supervised methods aim at maximizing agreement between features extracted from two differently transformed views of the same image, which results in learning an invariant representation with respect to appearance and geometric image transformations. However, the effectiveness of these approaches remains unclear in the context of gaze estimation, a structured regression task that requires equivariance under geometric transformations (e.g., rotations, horizontal flip). In this work, we propose SwAT, an equivariant version of the online clustering-based self-supervised approach SwAV, to learn more informative representations for gaze estimation. We demonstrate that SwAT, with ResNet-50 and supported with uncurated unlabeled face images, outperforms state-of-the-art gaze estimation methods and supervised baselines in various experiments. In particular, we achieve up to 57% and 25% improvements in cross-dataset and within-dataset evaluation tasks on existing benchmarks (ETH-XGaze, Gaze360, and MPIIFaceGaze).
연구 동기 및 목표
- 레이블이 부족하고 비용이 많이 드는 상황에서 자기지도 표현 학습의 효과성을 탐구하는 것.
- 기본적인 자기지도 학습 방법에서의 불변성(invariance)과 gaze 추정과 같은 구조적 회귀 과제에 필요한 동치성(equivariance) 간의 불일치를 해결하는 것.
- 회전 및 수평 반전과 같은 변환에 대해 동치성을 강제하여 기하학적 인식 능력을 향상시킨 더 정보적인 표현을 학습하는 방법을 개발하는 것.
- 대규모 정제되지 않은 얼굴 이미지에서 사전 훈련하는 것이 감독 기반 ImageNet 사전 훈련 및 최신 기술 수준의 방법보다 우수한 성능을 낼 수 있음을 보여주는 것.
- 최소한의 레이블 데이터로도 도메인 간 일반화를 향상시키기 위해 자기지도 학습을 활용하는 것.
제안 방법
- 기하학적 변환 효과를 특징에 유지하도록 대비 목표를 수정함으로써, SwAV 자기지도 학습 프레임워크의 동치성 변형인 SwAT을 제안한다.
- 클러스터링을 위한 양성 뷰(positive views)를 생성하기 위해 색상 왜곡, 무작위 자르기, 기하학적 변환(회전, 수평 반전) 등의 데이터 증강 기법을 적용한다.
- 변환된 입력의 특징 표현이 원본 입력의 변환된 특징과 일치하도록 하여 동치성을 강제하며, 이는 학습 가능한 변환 모듈을 사용한다.
- SwAV와 유사하게 온라인 클러스터링을 통해 뷰에 타겟을 할당하고 모멘터럼 기반 방식으로 프로토타입을 갱신한다.
- 하향식 gaze 추정을 위해 소규모 gaze 레이블이 부여된 데이터셋(예: ETH-XGaze, Gaze360)에서 사전 훈련된 SwAT 인코더를 미세조정한다.
- 모델이 변환 효과를 얼마나 잘 유지하는지 정량적으로 측정하기 위해 새로운 동치성 손실 ℒ_equ를 평가에 도입한다.
실험 결과
연구 질문
- RQ1정제되지 않은 대규모 레이블이 없는 얼굴 이미지를 사용한 자기지도 학습이 감독 기반 사전 훈련보다 gaze 추정 성능을 향상시키는가?
- RQ2기하학적 변환(예: 회전, 반전)에 대해 동치성을 강제하면 표준 불변성 기반 자기지도 학습 방법보다 gaze 추정에 더 나은 표현을 만들어내는가?
- RQ3SwAT은 서로 다른 분포에서 온 훈련 및 테스트 데이터를 사용할 때 교차 데이터셋 일반화 성능이 어떻게 되는가?
- RQ4실제 환경에서 대규모로 정제된 gaze 레이블이 부여된 데이터셋이 필요로 하는 양을 줄일 수 있는가?
- RQ5사전 훈련 데이터셋의 선택(예: VGG-Face 대비 ETH-XGaze)이 gaze 추정 모델의 최종 성능에 어떤 영향을 미치는가?
주요 결과
- SwAT은 교차 데이터셋 평가에서 감독 기반 기준 모델 대비 최대 57% 향상되었으며, 특히 MPIIFaceGaze 벤치마크에서 그러한 성과를 달성했다.
- 내부 데이터셋 평가에서 SwAT은 ETH-XGaze에서 최대 25% 향상되었고, MPIIFaceGaze∗에서 최대 19% 향상되었다.
- VGG-Face에서 사전 훈련한 SwAT은 감독 기반 기준 모델과 ETH-XGaze에서 사전 훈련한 SwAT보다 우수한 성능을 보여, 정제되지 않은 데이터의 효과성을 입증했다.
- Gaze360에서 SwAT은 SwAV 대비 동치성 손실(ℒ_equ)을 27% 향상시켰고, MPIIFaceGaze∗에서는 21% 향상시켜 더 강한 기하학적 동치성을 확인했다.
- Gaze360에서는 기존 최고 기술 수준 대비 9% 향상되었고, MPIIFaceGaze∗에서는 ETH-XGaze 방법 대비 비정규화 설정에서 0.2° 향상되었다.
- 비구속적인 환경에서도 잘 일반화되며, 다양한 테스트 도메인과 변환 유형에서 일관된 성능 향상을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.