Skip to main content
QUICK REVIEW

[논문 리뷰] Jitter Does Matter: Adapting Gaze Estimation to New Domains

Ruicong Liu, Yiwei Bao|arXiv (Cornell University)|2022. 10. 05.
Neonatal and fetal brain pathology인용 수 4
한 줄 요약

이 논문은 고주파 성분(HFC)을 주요 원인으로 규명함으로써, 유사한 이미지에 대해 심한 예측 이격( gaze jitter)을 유발하는 문제를 완화하는 새로운 시선 추정 적응 프레임워크를 제안한다. 적대적 HFC 노이즈를 적용하고, 원본 및 변형된 입력 간의 특징 일관성을 확보하기 위해 대조 학습을 활용함으로써, 극소수의 타겟 데이터로도 예측의 일관성과 교차 도메인 시선 추정 정확도를 크게 향상시킨다.

ABSTRACT

Deep neural networks have demonstrated superior performance on appearance-based gaze estimation tasks. However, due to variations in person, illuminations, and background, performance degrades dramatically when applying the model to a new domain. In this paper, we discover an interesting gaze jitter phenomenon in cross-domain gaze estimation, i.e., the gaze predictions of two similar images can be severely deviated in target domain. This is closely related to cross-domain gaze estimation tasks, but surprisingly, it has not been noticed yet previously. Therefore, we innovatively propose to utilize the gaze jitter to analyze and optimize the gaze domain adaptation task. We find that the high-frequency component (HFC) is an important factor that leads to jitter. Based on this discovery, we add high-frequency components to input images using the adversarial attack and employ contrastive learning to encourage the model to obtain similar representations between original and perturbed data, which reduces the impacts of HFC. We evaluate the proposed method on four cross-domain gaze estimation tasks, and experimental results demonstrate that it significantly reduces the gaze jitter and improves the gaze estimation performance in target domains.

연구 동기 및 목표

  • 교차 도메인 시선 추정에서 유사한 이미지가 매우 다른 시선 예측을 내보내는 원인을 규명하는 것.
  • 목표 도메인에서 시선 흔들림을 유발하는 주요 요인으로 고주파 성분(HFC)을 특정하는 것.
  • HFC 영향을 억제함으로써 일반화 능력을 향상시키고 예측 일관성을 감소시키는 도메인 적응 프레임워크를 개발하는 것.
  • 제한된 타겟 데이터로도 여러 교차 도메인 시선 추정 벤치마크에서 방법의 효과성을 검증하는 것.

제안 방법

  • 입력 이미지에 적대적 고주파 성분(HFC) 노이즈를 도입하여 흔들림을 유발하는 노이즈를 시뮬레이션하고 노출시킨다.
  • 원본 이미지와 HFC 노이즈가 가해진 이미지의 특징 표현 간 일치를 도모하기 위해 대조 학습을 적용함으로써 고주파 변동에 대한 내성을 향상시킨다.
  • 양의 쌍(원본 및 노이즈가 가해진 이미지) 간의 거리를 최소화하고 음의 쌍 간의 거리를 최대화하는 대조 손실을 사용해 종합적으로 엔드 투 엔드로 학습한다.
  • 소량의 타겟 도메인 레이블 없음 샘플을 사용해 미세조정함으로써 무 supervision 도메인 적응을 실현한다.
  • 기본 네트워크는 ResNet18이며, 적응 과정은 HFC 노이즈에 대한 예측 안정성을 확보하기 위해 대조 학습 목표를 사용한다.
  • 표준 UDA 설정 하에서 방법을 평가하였으며, 아블레이션 스터디를 통해 HFC와 대조 학습이 흔들림 감소에 기여하는 것으로 확인되었다.

실험 결과

연구 질문

  • RQ1교차 도메인 시선 추정에서 매우 유사한 이미지에 대해 심한 시선 예측 이격(흔들림)이 발생하는 원인은 무엇인가?
  • RQ2원본 도메인에선 일관된 예측을 보일 텐데도 불구하고, 왜 시선 흔들림이 주로 타겟 도메인에서 발생하는가?
  • RQ3고주파 성분(HFC)이 교차 도메인 환경에서 시선 흔들림의 근본 원인으로서 얼마나 중요한가?
  • RQ4적대적 HFC 삽입과 대조 학습을 조합하면 시선 흔들림을 효과적으로 줄이고 도메인 일반화 능력을 향상시킬 수 있는가?
  • RQ5제안된 방법은 시선 추정 분야의 최신 무 supervision 도메인 적응 기법들과 비교해 어떻게 성능을 내는가?

주요 결과

  • E→M 작업에서 제안된 방법은 평균 절대 오차(MAE)를 8.56°에서 5.35°로 2.96° 감소시켜 기준 모델을 크게 능가한다.
  • G→D 작업에서는 MAE가 4.41°를 기록하여 기준 모델의 7.68° 대비 3.27° 향상되었으며, 강력한 일반화 능력을 입증한다.
  • 모든 테스트된 교차 도메인 작업에서 시선 흔들림이 30–50% 감소하였으며, 유사한 이미지 쌍에 대한 예측 일관성 측정 기준으로 확인되었다.
  • 적응 후 원본 도메인 성능은 약 0.5° 이내로 약간 떨어지며, 부정적 전이의 영향이 최소한임을 시사한다.
  • 단지 100개의 타겟 샘플만으로도 DAGEN, GazeAdv, PureGaze와 같은 최신 UDA 기법들을 모두 초월하는 성능을 기록하였다.
  • 아블레이션 스터디를 통해 HFC가 흔들림의 주요 기여 요인임이 확인되었으며, 대조 학습이 이에 대한 영향을 효과적으로 완화함을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.