Skip to main content
QUICK REVIEW

[논문 리뷰] A Generalized and Robust Method Towards Practical Gaze Estimation on Smart Phone

Tianchu Guo, Yongchao Liu|arXiv (Cornell University)|2019. 10. 16.
Gaze Tracking and Assistive Technology참고 문헌 31인용 수 4
한 줄 요약

이 논문은 스마트폰에서 과적합과 예측의 요동을 해결하기 위해 내성적이고 뛰어난(Tolerant and Talented, TAT) 훈련 방식과 순서 손실을 고려한 교란(Disturbance with Ordinal loss, DwO) 방법을 제안한다. TAT는 코사인 유사도 기반의 정규화와 정렬된 직교 초기화를 통한 반복 지식 정련을 활용하여 과적합을 줄이고 일반화 능력을 향상시키며, DwO는 순서 손실을 활용한 적대적 훈련을 통해 강건성을 향상시킨다. 이들 방법은 GazeCapture에서 최고 성능을 기록했고, 새로운 강건성 기준 평가 기준에서 예측의 요동을 크게 감소시켰다.

ABSTRACT

Gaze estimation for ordinary smart phone, e.g. estimating where the user is looking at on the phone screen, can be applied in various applications. However, the widely used appearance-based CNN methods still have two issues for practical adoption. First, due to the limited dataset, gaze estimation is very likely to suffer from over-fitting, leading to poor accuracy at run time. Second, the current methods are usually not robust, i.e. their prediction results having notable jitters even when the user is performing gaze fixation, which degrades user experience greatly. For the first issue, we propose a new tolerant and talented (TAT) training scheme, which is an iterative random knowledge distillation framework enhanced with cosine similarity pruning and aligned orthogonal initialization. The knowledge distillation is a tolerant teaching process providing diverse and informative supervision. The enhanced pruning and initialization is a talented learning process prompting the network to escape from the local minima and re-born from a better start. For the second issue, we define a new metric to measure the robustness of gaze estimator, and propose an adversarial training based Disturbance with Ordinal loss (DwO) method to improve it. The experimental results show that our TAT method achieves state-of-the-art performance on GazeCapture dataset, and that our DwO method improves the robustness while keeping comparable accuracy.

연구 동기 및 목표

  • 스마트폰 간섭 추정에서 과적합으로 인한 훈련과 테스트 성능 간 격차를 해소하기 위해.
  • 실시간 응용 프로그램에서 사용자 경험을 떨어뜨리는 간섭 중 예측 요동을 줄이기 위해.
  • 간섭 추정 강건성의 정량적 평가를 위해 새로운 지표와 데이터셋을 개발하기 위해.
  • 정확도를 희생시키지 않은 채 새로운 훈련 체계를 통해 일반화 능력과 강건성을 향상시키기 위해.
  • 소비자용 스마트폰에서의 간섭 추정의 실용적 구현을 가능하게 하기 위해.

제안 방법

  • 다양하고 유용한 지도 정보를 무작위로 선택된 교사 네트워크로부터 확보하는 반복적인 무작위 지식 정련 프레임워크를 제안하여 내성적인 가르침 과정을 구현한다.
  • 과도하고 유용성이 낮은 가중치를 제거하기 위해 코사인 유사도 정규화를 도입하여 모델의 효율성과 일반화 능력을 향상시킨다.
  • 서로 수직이면서 원래 분포와 정렬된 가중치를 재초기화하는 정렬된 직교 초기화(AOI) 방법을 개발하여 최적화 재시작의 향상을 도모한다.
  • 예측 요동과 강건성을 평가하기 위해 새로운 강건성 지표(MSD)를 설계하고, 새로운 데이터셋(GazeStare)을 수집한다.
  • 순서 손실에 기반한 적대적 훈련 방법인 Disturbance with Ordinal loss(DwO)를 제안하여, 순서 손실의 버킷에 교란을 가해 강건성을 향상시킨다.
  • 통제된 교란 강도와 데이터 유지율(Org.%)을 갖춘 PGD 기반의 적대적 훈련을 수행하며, 초모수 최적화를 통해 조정한다.

실험 결과

연구 질문

  • RQ1정규화와 재초기화를 통한 반복 지식 정련 프레임워크가 제한된 데이터셋에서 간섭 추정의 과적합을 줄일 수 있는가?
  • RQ2코사인 유사도 정규화와 정렬된 직교 초기화가 간섭 추정에서 모델의 일반화 능력과 수렴 성능을 향상시키는가?
  • RQ3새로운 지표와 데이터셋이 실생활 조건에서 간섭 예측의 요동을 효과적으로 정량화하고 평가할 수 있는가?
  • RQ4순서 손실을 고려한 적대적 훈련(DwO)이 높은 정확도를 유지하면서 요동을 크게 줄일 수 있는가?
  • RQ5제안된 TAT와 DwO 방법이 GazeCapture 및 GazeStare와 같은 벤치마크 데이터셋에서 최고 성능을 달성할 수 있는가?

주요 결과

  • TAT 훈련 체계는 GazeCapture 데이터셋에서 기존 방법들을 능가하는 최고 성능을 기록했다.
  • DwO 방법은 기준선 대비 평균 제곱편차(MSD)를 19.2% 감소시켰고, 정확도는 유사하게 유지했다(기준선 1.20 cm 대비 1.15 cm 오차).
  • DwO에서 T=1 및 Org.%=90% 조건을 사용할 경우 강건성과 정확도 사이의 최적의 균형을 확보하여 MSD를 0.42 cm에서 0.36 cm로 감소시켰다.
  • 제안된 정렬된 직교 초기화 방법은 더 안정적인 가중치 분포를 제공했으며, L2 노름이 정규화된 가중치와 유사하게 유지되어 네트워크 붕괴를 방지했다.
  • DwO로 훈련된 모델은 도시 1(b)에서 시각화된 바와 같이 간섭 중에 예측 점의 요동이 현저히 줄었으며, 진짜 간섭 지점 주변으로 더 집중되어 있었다.
  • 순서 손실의 중심 버킷 수가 핵심 요소이다: 8개의 버킷이 효과적인 교란과 모델 안정성의 균형을 이끌어내 최적의 성능을 낳는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.