[논문 리뷰] Real-time Pupil Tracking from Monocular Video for Digital Puppetry
이 논문은 외부 센서나 캘리브레이션 없이 모바일 기기에서 실시간으로 단일 영상 기반의 동공 추적 시스템을 제안한다. 경량 신경망을 사용하여 5개의 주요 눈 구조점(동공 중심 및 외측 망막)을 검출하고, 이동 기반 히우리스틱을 통해 동공 블렌드 샤프 모수를 추정한다. 이 방법은 현대 스마트폰에서 50 FPS 이상의 성능을 달성하며, 보정 없이도 보다 자연스럽고 반응성이 뛰어난 가상 애니메이션을 가능하게 한다.
We present a simple, real-time approach for pupil tracking from live video on mobile devices. Our method extends a state-of-the-art face mesh detector with two new components: a tiny neural network that predicts positions of the pupils in 2D, and a displacement-based estimation of the pupil blend shape coefficients. Our technique can be used to accurately control the pupil movements of a virtual puppet, and lends liveliness and energy to it. The proposed approach runs at over 50 FPS on modern phones, and enables its usage in any real-time puppeteering pipeline.
연구 동기 및 목표
- 모바일 기기에서 외부 센서나 캘리브레이션 없이 실시간으로 정확한 동공 추적을 가능하게 하기.
- 정적 또는 동공 이동이 없는 가상 애니메이션 캐릭터의 표현력 부족 문제를 해결하기.
- 보정이 필요 없고 종단 간 엔드 투 엔드 파이프라인을 개발하여 기존 얼굴 메시 모델과 통합하기.
- 소비자용 모바일 하드웨어에서 실시간 성능(50+ FPS)을 확보하기 위해 경량 모델을 사용하기.
- 검출된 구조점을 기반으로 블렌드 샤프 추정을 통해 자연스럽고 동적인 눈 움직임을 구현하기
제안 방법
- 작고 효율적인 신경망이 얼굴 메시 예측에서 잘라낸 64×64 크기의 눈 영역을 처리하여 5개의 주요 2차원 눈 구조점(동공 중심 및 4개의 외측 망막 점)을 검출한다.
- 검출된 구조점을 원본 얼굴 메시와 융합하여 x, y 좌표를 교체하고 z 깊이를 유지함으로써 메시를 478개 정점으로 확장한다.
- 현재 정점 간격을 경험적으로 유도된 중립 상태 및 활성 상태(내측, 외측, 상향, 하향)와 비교하여 이동 기반 방법으로 블렌드 샤프 모수를 계산한다.
- 실시간 표준 점수 필터는 신뢰할 수 있는 측정치의 원형 버퍼를 사용하여 동적으로 이동 임계값을 보정함으로써 개인별 눈 기하학적 차이를 실시간으로 보완한다.
- 후처리 단계로 스무딩과 양안 간 상호작용을 적용하여 진동을 줄이고, 더욱 매끄럽고 자연스러운 눈 애니메이션을 보장한다.
- 파이프라인은 TensorFlow Lite를 사용하고 MediaPipe를 통한 GPU 가속을 통해 모바일 기기에서 효율적으로 작동한다.
실험 결과
연구 질문
- RQ1외부 센서나 캘리브레이션 없이 단일 영상에서 실시간으로 정확한 동공 추적을 모바일 기기에서 달성할 수 있는가?
- RQ2가상 퍼펫 애니메이션에 사용하기 위해 동공 움직임을 의미 있는 블렌드 샤프 모수로 매핑하는 방법은 무엇인가?
- RQ3모바일 배포에 최적화된 정확도, 추론 속도, 메모리 점유율 간의 최적 균형은 무엇인가?
- RQ4사용자 간 눈 기하학적 차이를 사전 캘리브레이션 없이 실시간으로 보완할 수 있는가?
- RQ5기존 얼굴 메시 파이프라인과 원활하게 통합되는 경량이고 종단 간 엔드 투 엔드 시스템을 구축할 수 있는가?
주요 결과
- 모델은 보류된 테스트 세트에서 눈 간 거리로 정규화된 평균 절대 거리(MAD IED)가 7.16%를 기록하였으며, 기준 수작업 주석 오차(어려운 케이스 기준 7.04%)를 초월하였다.
- 현대 스마트폰에서 시스템은 50 FPS 이상으로 작동하며, 아이폰 X에서 눈 정밀화 네트워크의 추론 시간은 최소 2.6ms에 이르렀다.
- 실시간 표준 점수 필터는 개인별 사용자 차이를 성공적으로 보정하였으며, 그림 3에서 보듯이 시간이 지남에 따라 이동 임계값이 안정화됨을 확인하였다.
- 후처리 및 이면 간 상호작용을 통해 매끄럽고 진동 없는 눈 애니메이션을 구현하여 시각적 현실감을 향상시켰다.
- 이 방법은 어떤 얼굴 메시 파이프라인에도 일반화 가능하며, 개인별 캘리브레이션 또는 깊이 센서가 필요로 하지 않는다.
- 최종 파이프라인은 그림 1에서 렌더링된 가상 캐릭터를 통해 자연스러운 동공 역학을 구현한 실시간 퍼펫리즘을 지원한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.