[논문 리뷰] PureGaze: Purifying Gaze Feature for Generalizable Gaze Estimation
PureGaze는 자가대칭 학습 기반의 자체적이고 즉각적인 도메인 일반화 프레임워크를 제안하여, 조명 및 신원과 같은 시선과 관련이 없는 요소를 제거함으로써 시선 특징을 정제한다. 동시에 시선 유지 및 얼굴 이미지 재구성 최적화를 통해 타겟 도메인 데이터가 필요 없이도 시선 추정에서 최신 기술 성능을 달성하며, 예측되지 않은 데이터셋 간의 일반화 능력을 크게 향상시킨다.
Gaze estimation methods learn eye gaze from facial features. However, among rich information in the facial image, real gaze-relevant features only correspond to subtle changes in eye region, while other gaze-irrelevant features like illumination, personal appearance and even facial expression may affect the learning in an unexpected way. This is a major reason why existing methods show significant performance degradation in cross-domain/dataset evaluation. In this paper, we tackle the cross-domain problem in gaze estimation. Different from common domain adaption methods, we propose a domain generalization method to improve the cross-domain performance without touching target samples. The domain generalization is realized by gaze feature purification. We eliminate gaze-irrelevant factors such as illumination and identity to improve the cross-domain performance. We design a plug-and-play self-adversarial framework for the gaze feature purification. The framework enhances not only our baseline but also existing gaze estimation methods directly and significantly. To the best of our knowledge, we are the first to propose domain generalization methods in gaze estimation. Our method achieves not only state-of-the-art performance among typical gaze estimation methods but also competitive results among domain adaption methods. The code is released in https://github.com/yihuacheng/PureGaze.
연구 동기 및 목표
- 조명 및 신원과 같은 도메인 이동 요인으로 인해 시선 추정 모델의 성능 저하 문제를 해결하기 위해.
- 타겟 도메인 데이터나 레이블에 접근할 수 없더라도 모델의 강건성을 향상시키는 도메인 일반화 방법을 개발하기 위해.
- 기존의 시선 추정 모델을 향상시키기 위해 시선과 관련된 특징을 시야 외 요소에서 정제하는 즉각적인 모듈을 설계하기 위해.
- 모든 시선과 관련이 없는 특성들을 명시적으로 정의하지 않고도 암묵적으로 시선 특징을 정제함으로써 다양한 환경 간의 더 나은 일반화를 가능하게 하기 위해.
제안 방법
- 자기 대칭 프레임워크를 활용하여 두 가지 경쟁적인 목적을 구현: 시선과 관련된 특징 유지 및 원본 얼굴 이미지 재구성.
- 시선 유지 작업은 특징 맵 상에 두 층의 완전 연결층(MLP)을 적용한 표준 시선 추정 헤드로 구현된다.
- 재구성 작업은 정제된 특징 맵에서 입력 이미지를 재구성하는 적대적 autoencoder로 구현된다.
- SA-모듈(Self-adversarial Module)은 특징 맵 채널 수가 감소하는 다섯 층의 잔차 블록으로 구성되며, 입력 해상도와 공간적으로 정렬된 특징 맵을 출력하도록 설계되었다.
- 전체 손실 함수는 시선 추정 손실과 재구성 손실을 조합하며, 하이퍼파라미터 α=1, β=1, k=0.75를 사용하고, 주의 맵 분산 σ²=20 픽셀이다.
- 프레임워크는 즉각적인 통합이 가능하여 ResNet-18와 같은 기존의 시선 추정 백본과 아키텍처 변경 없이 통합 가능하다.
실험 결과
연구 질문
- RQ1타겟 도메인 데이터에 접근하지 않더라도 시선 추정 모델이 예측되지 않은 도메인 간에 일반화 성능을 향상시킬 수 있는가?
- RQ2자기 대칭 프레임워크는 조명 및 신원과 같은 시선과 관련이 없는 요소를 제거함으로써 시선 특징을 얼마나 효과적으로 정제할 수 있는가?
- RQ3특징 정제가 극단적인 조명 조건과 다양한 데이터셋에서 측정 가능한 성능 향상으로 이어지는가?
- RQ4제안된 즉각적인 모듈은 아키텍처 수정 없이도 기존의 시선 추정 방법을 향상시킬 수 있는가?
- RQ5교차 데이터셋 평가에서 제안된 방법은 표준 시선 추정 및 도메인 적응 기반 모델과 비교해 어떻게 성능를 보이는가?
주요 결과
- PureGaze는 여러 벤치마크에서 최신 기술 성능을 달성하여 표준 시선 추정 방법과 도메인 적응 기반 모델을 모두 압도한다.
- 극단적인 조명 조건에서도 성능 향상이 뚜렷하게 나타나며, 저조도 및 고조도 클러스터에서 두드러진 성과를 기록한다.
- 시각화 결과는 방법이 특징 공간에서 조명 및 신원 관련 요소를 성공적으로 제거하면서도 시선과 관련된 정보는 유지하고 있음을 확인한다.
- 즉각적인 SA-모듈은 기존의 시선 추정 모델에 직접적이고 일관된 방식으로 성능 향상을 이끌어내며, 광범위한 호환성과 효과성을 입증한다.
- 절단 실험에서 이중 목적의 자기 대칭 학습 기반 방법은 단일 작업 기반 모델보다 더 일반화된 특징을 생성한다.
- 모델은 타겟 도메인 데이터나 미세 조정 없이도 다양한 데이터셋에서 강력한 성능 유지를 보이며, 도메인 일반화 능력이 확인된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.