[논문 리뷰] Optimization-Based Eye Tracking using Deflectometric Information
이 논문은 스크린 조명을 통해 얻은 픽셀 밀도가 높은 변형측정 표면 측정치를 활용하여 고정밀 시선 추정을 가능하게 하는 최적화 기반의 눈 추적 방법을 제안한다. 파이토치3D의 미분 가능 렲링 파이프라인을 활용해 반사광을 시뮬레이션하고, 기울기 하강법을 통해 눈의 자세, 이동, 형태 파라미터를 동시에 최적화함으로써 평균 상대 시선 오차가 0.45° 이하인 결과를 도출하였으며, 시뮬레이션에서 기존의 반사 기반 방법 대비 6배 향상된 성능을 보였다.
Eye tracking is an important tool with a wide range of applications in Virtual, Augmented, and Mixed Reality (VR/AR/MR) technologies. State-of-the-art eye tracking methods are either reflection-based and track reflections of sparse point light sources, or image-based and exploit 2D features of the acquired eye image. In this work, we attempt to significantly improve reflection-based methods by utilizing pixel-dense deflectometric surface measurements in combination with optimization-based inverse rendering algorithms. Utilizing the known geometry of our deflectometric setup, we develop a differentiable rendering pipeline based on PyTorch3D that simulates a virtual eye under screen illumination. Eventually, we exploit the image-screen-correspondence information from the captured measurements to find the eye's rotation, translation, and shape parameters with our renderer via gradient descent. In general, our method does not require a specific pattern and can work with ordinary video frames of the main VR/AR/MR screen itself. We demonstrate real-world experiments with evaluated mean relative gaze errors below 0.45 degrees at a precision better than 0.11 degrees. Moreover, we show an improvement of 6X over a representative reflection-based state-of-the-art method in simulation.
연구 동기 및 목표
- 단지 약 12개의 글린트 점에 의존하는 희박한 반사 기반 눈 추적 방법의 한계를 해결하기 위해.
- 스크린 조명으로부터 얻은 고밀도 픽셀 수준의 표면 대응 관계를 활용하여 시선 추적 정확도를 향상시키기 위해.
- 반사광을 모델링하고 눈 자세 및 형태 추정을 위한 동시 최적화를 가능하게 하는 미분 가능 련링 파이프라인을 개발하기 위해.
- 확장된 스크린 조명이 희박한 점광원보다 훨씬 더 밀도 높고 강건한 표면 정보를 제공하는지 확인하기 위해.
- 실세계 실험을 통해 높은 정밀도와 낮은 오차를 달성함으로써 방법의 타당성을 검증하기 위해.
제안 방법
- 희박한 점광원을 대체하여 알려진 고주파 정현파 패턴을 표시하는 자기 조명 스크린을 사용한다.
- 위상 이동 기법을 통해 변형측정 측정치를 캡처하여 래핑 및 언래핑된 위상도를 추출함으로써 고밀도 영상-스크린 대응 관계를 확보한다.
- 파이토치3D 기반의 미분 가능 렌더링 파이프라인은 스크린 조명 하에서의 가상 눈을 시뮬레이션하고, 반사광과 빛 전달을 모델링한다.
- 광도 및 상관 기반 손실을 최소화하기 위해 기울기 하강법을 활용해 눈의 자세, 이동, 형태 파라미터를 동시에 최적화한다.
- 측정된 대응 정보와 알려진 변형측정 설정 기하학을 활용해 3차원 눈 모델을 정밀하게 보정한다.
- 외부 마커나 표준 카메라 및 스크린 이외의 특수 하드웨어가 필요 없이 작동한다.
실험 결과
연구 질문
- RQ1스크린 조명으로부터 얻은 고밀도 표면 대응 관계가 희박한 글린트 기반 방법에 비해 시선 추적 정확도를 크게 향상시킬 수 있는가?
- RQ2반사광을 모델링하는 미분 가능 렌더링 파이프라인이 눈 자세 및 형태 추정을 위한 정확한 역 렌더링을 가능하게 하는가?
- RQ3대응 점의 밀도가 시선 추정 정밀도 및 오차에 어떤 영향을 미치는가?
- RQ4단일 카메라 시야와 VR/AR/MR 스크린의 표준 영상 프레임만으로도 높은 정확도를 달성할 수 있는가?
- RQ5조명 패턴의 선택(예: 고주파 대비 저주파)이 대응 품질과 추적 성능에 어떤 영향을 미치는가?
주요 결과
- 실세계 실험에서 평균 상대 시선 오차는 0.42°이며 정밀도는 0.19°이며, 대응 완전도가 1/500일 경우 최대 오차는 1.52°였다.
- 시뮬레이션에서는 시선 오차가 상관 기반 손실 기준 0.03°, 광도 기반 손실 기준 0.07°로 감소하여, 대표적인 글린트 추적 기반 기준 대비 6배 향상된 성능을 보였다.
- 대응 관계가 희박해질수록 성능이 저하되며, 대응 완전도가 1/500일 경우 평균 오차는 1.52°로 증가하고 정밀도는 4.52°로 상승하여 고밀도 데이터의 중요성을 입증했다.
- 고주파 정현파 패턴이 저주파 패턴보다 더 강건하고 정확한 대응 관계를 제공함을 위상 이동 측정 원리에 의해 확인하였다.
- 이 방법은 시뮬레이션 뿐 아니라 실세계 테스트에서도 글린트 추적 방식을 뛰어넘었으며, SIFT 특징을 사용할 경우 평균 오차 0.15°를 기록하여 글린트 추적 대비 0.20°의 오차를 기록했다.
- 광도 기반 손실 함수가 상관 기반 손실 함수보다 더 우수한 일반화 성능을 보였으며, 이는 실세계 조건에서의 강건성 잠재력을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.