[논문 리뷰] LatentGaze: Cross-Domain Gaze Estimation through Gaze-Aware Analytic Latent Code Manipulation
LatentGaze는 GAN 역설계를 통한 분리된 잠재 코드의 시야 인식 조작을 활용하여 시야 관련 특징을 분리하는 새로운 교차 도메인 시야 추정 방법을 제안한다. GAN 기반의 인코더-디코더를 사용하여 타겟 도메인 이미지를 소스 도메인으로 투영하고, 시야 왜곡 손실을 적용함으로써, 교차 데이터셋 시야 추정에서 최신 기술 수준의 정확도를 달성한다.
Although recent gaze estimation methods lay great emphasis on attentively extracting gaze-relevant features from facial or eye images, how to define features that include gaze-relevant components has been ambiguous. This obscurity makes the model learn not only gaze-relevant features but also irrelevant ones. In particular, it is fatal for the cross-dataset performance. To overcome this challenging issue, we propose a gaze-aware analytic manipulation method, based on a data-driven approach with generative adversarial network inversion's disentanglement characteristics, to selectively utilize gaze-relevant features in a latent code. Furthermore, by utilizing GAN-based encoder-generator process, we shift the input image from the target domain to the source domain image, which a gaze estimator is sufficiently aware. In addition, we propose gaze distortion loss in the encoder that prevents the distortion of gaze information. The experimental results demonstrate that our method achieves state-of-the-art gaze estimation accuracy in a cross-domain gaze estimation tasks. This code is available at https://github.com/leeisack/LatentGaze/.
연구 동기 및 목표
- 모호한 시야 관련 특징 정의로 인한 교차 도메인 시야 추정에서의 불필요한 특징 학습 문제를 해결하기 위해.
- GAN 기반의 이미지 번역을 통해 타겟 도메인 이미지를 소스 도메인으로 정렬하여 도메인 분리 문제를 극복하기 위해.
- 인코더 과정에서 시야 왜곡 손실을 도입하여 도메인 적응 중 시야 정보가 유지되도록 보장하기 위해.
- 잠재 공간에서의 시야 관련 구성 요소 분리함으로써 다양한 데이터셋 간에 강건한 시야 추정을 가능하게 하기 위해.
- 잠재 코드의 분석적 조작을 통해 모델이 분류 가능한 시야 관련 특징에 집중하도록 하여 일반화 성능 향상시키기 위해.
제안 방법
- 타겟 도메인 눈 이미지를 소스 도메인 분포로 역설계하는 GAN 기반 인코더-디코더 프레임워크를 사용하여 도메인 분리를 감소시키기 위해.
- 잠재 공간에서의 분리 특성 조작을 적용하여 시야 관련 구성 요소를 선택적으로 추출하고 강화하기 위해.
- 이미지 번역 과정에서 시야 정보가 유지되도록 인코딩 과정 중 시야 왜곡 손실을 도입하기 위해.
- GAN 역설계의 분리 특성을 활용하여 신원 및 조명 변화에서 시야 전용 특징을 분리하기 위해.
- 이제 의미적으로 학습 분포와 정렬된 소스 도메인 이미지에서 시야 추정기 학습을 수행하기 위해.
- 재구성, 적대적, 시야 전용 손실의 조합을 사용하여 전체 파ipeline를 엔드 투 엔드로 최적화하기 위해.
실험 결과
연구 질문
- RQ1분리된 잠재 코드의 시야 인식 조작은 교차 도메인 시야 추정 성능을 향상시킬 수 있는가?
- RQ2GAN 기반의 이미지 번역은 시야 추정에서 도메인 분리를 줄이는 데 얼마나 효과적인가?
- RQ3시야 왜곡 손실은 도메인 적응 중 시야 관련 특징의 열화를 어느 정도 방지하는가?
- RQ4잠재 코드의 분석적 조작은 기존의 특징 추출 방식보다 교차 데이터셋 시야 추정에서 더 나은 성능을 내는가?
- RQ5제안된 방법은 조명, 자세, 신원 조건이 다양한 다양한 데이터셋 간에 일반화되는가?
주요 결과
- 제안된 방법은 여러 교차 도메인 시야 추정 벤치마크에서 최신 기술 성능을 달성한다.
- 시야 왜곡 손실은 이미지 번역 과정에서 시야 관련 특징의 열화를 크게 감소시킨다.
- 잠재 코드 조작은 시야 관련 구성 요소에 대한 선택적 집중을 가능하게 하여 불필요한 특징 간섭을 줄인다.
- GAN 기반의 이미지 번역은 타겟 도메인 이미지를 소스 도메인 분포와 효과적으로 정렬하여 일반화 성능 향상에 기여한다.
- 모델은 다양한 데이터셋, 특히 조명과 자세 조건이 다양한 새로운 도메인에서도 강건한 성능을 보여준다.
- 절단 실험은 시야 왜곡 손실과 시야 인식 잠재 조작 구성 요소의 효과성을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.