[논문 리뷰] Contrastive Representation Learning for Gaze Estimation
이 논문은 다중 시야 카메라 데이터를 활용하여 외관 변화에 대해 불변이고 카메라 시점 변화에 대해 등변인 표현을 학습하는 대비 표현 학습 프레임워크인 GazeCLR을 제안한다. 눈동자 방향을 유지하는 증강 기법을 사용한 대비 학습을 통해 레이블이 없는 다중 시야 데이터에서 사전 훈련함으로써, GazeCLR은 도메인 간 눈동자 추정에서 최대 17.2%의 상대적 향상도를 달성하며, 소수의 샘플로도 경쟁적인 성능을 보인다.
Self-supervised learning (SSL) has become prevalent for learning representations in computer vision. Notably, SSL exploits contrastive learning to encourage visual representations to be invariant under various image transformations. The task of gaze estimation, on the other hand, demands not just invariance to various appearances but also equivariance to the geometric transformations. In this work, we propose a simple contrastive representation learning framework for gaze estimation, named Gaze Contrastive Learning (GazeCLR). GazeCLR exploits multi-view data to promote equivariance and relies on selected data augmentation techniques that do not alter gaze directions for invariance learning. Our experiments demonstrate the effectiveness of GazeCLR for several settings of the gaze estimation task. Particularly, our results show that GazeCLR improves the performance of cross-domain gaze estimation and yields as high as 17.2% relative improvement. Moreover, the GazeCLR framework is competitive with state-of-the-art representation learning methods for few-shot evaluation. The code and pre-trained models are available at https://github.com/jswati31/gazeclr.
연구 동기 및 목표
- 딥 러닝 기반 눈동자 추정에서 레이블이 부족한 문제를 해결한다.
- 자기 지율 학습을 활용하여 비용이 많이 들고 시간이 오래 걸리는 눈동자 애너테이션에 대한 의존도를 줄인다.
- 비지도 사전 훈련을 통해 눈동자 추정의 도메인 간 일반화 능력을 향상시킨다.
- 외관 변화에 대한 불변성과 카메라 시점 변화에 대한 등변성을 동시에 학습한다.
- 기하 기반 시각 작업에 적용 가능한 일반화 가능한 등변 표현 학습 프레임워크를 개발한다.
제안 방법
- 두 단계 프레임워크를 사용: GazeCLR을 통한 비지도 사전 훈련 후 소량의 레이블 데이터에서의 테일러닝.
- 동일한 눈동자 방향을 유지하면서 서로 다른 카메라 시점에서 동시에 촬영한 다중 시야 이미지에서 양성 쌍을 구성한다.
- 눈동자 방향을 변경하지 않는 색조 조정 및 무작위 크롭과 같은 데이터 증강 기법을 적용하여 불변성을 유도한다.
- 회전 행렬을 사용하여 알려진 상대적 카메라 자세를 활용해 서로 다른 시야 간의 눈동자 방향을 연결함으로써 등변성을 강제한다.
- 동일한 주체, 동일한 눈동자 방향을 가진 양성 쌍은 임베딩 공간에서 가까이 있도록, 음성 쌍은 멀어지도록 대비 학습 목표를 훈련한다.
- 사전 훈련 단계에서는 눈동자 레이블을 기각하고 카메라 자세 정보만을 사용하여 등변성 학습을 수행하기 위해 EVE 다중 시야 눈동자 데이터셋을 활용한다.
실험 결과
연구 질문
- RQ1대비 표현 학습이 불변성과 등변성을 균형 있게 조절함으로써 눈동자 추정에 효과적으로 적용될 수 있는가?
- RQ2레이블이 없는 다중 시야 데이터에서의 사전 훈련이 도메인 간 눈동자 추정의 일반화 능력을 어떻게 향상시키는가?
- RQ3GazeCLR은 소수의 레이블 샘플로 테일러닝할 경우 필요한 레이블 수를 얼마나 줄일 수 있는가?
- RQ4다중 시야 기하학을 통한 등변성 학습이 표준 불변성 전용 접근 방식에 비해 표현 품질을 향상시키는가?
- RQ5제안된 프레임워크는 소스 도메인을 초월해 MPIIGaze 및 Columbia과 같은 다양한 데이터셋에서도 잘 작동하는가?
주요 결과
- GazeCLR은 기준 방법에 비해 도메인 간 눈동자 추정 성능에서 최대 17.2%의 상대적 향상을 달성한다.
- 이 프레임워크는 소수의 샘플로도 강력한 일반화 성능을 보이며, 제한된 레이블 데이터에서 테일러닝할 경우 최신 표현 학습 방법과 경쟁적인 성능을 보인다.
- t-SNE 시각화 결과 GazeCLR이 분리된 표현을 학습하는 것으로 확인되었으며, 동일 주체의 서로 다른 시야에서의 임베딩은 뭉쳐 있고, 다른 주체의 표현은 분리되어 있다.
- 모델은 외관 변화(예: 조명, 신원)에 대해 불변이고, 회전 인식 대비 학습을 통해 시점 변화에 대해 등변인 표현을 학습한다.
- 알려진 카메라 자세를 가진 다중 시야 데이터의 사용은 사전 훈련 단계에서 눈동자 애너테이션을 필요로 하지 않으면서도 효과적인 등변성 학습을 가능하게 한다.
- GazeCLR의 사전 훈련된 인코더는 MPIIGaze 및 Columbia과 같은 타겟 도메인으로도 잘 일반화되며, 최소한의 테일러닝 데이터로도 우수한 성능을 보인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.