[논문 리뷰] Attention Mesh: High-fidelity Face Mesh Prediction in Real-time
Attention Mesh는 영역에 집중된 헤드를 갖춘 3D 얼굴 메쉬를 예측하는 통합적이고 경량의 모델로, 공간 변환기를 통해 연쇄형(cascaded) 수준의 정확도를 달성하면서 모바일에서 >50 FPS 이상의 빠른 온디바이스 성능을 제공합니다.
We present Attention Mesh, a lightweight architecture for 3D face mesh prediction that uses attention to semantically meaningful regions. Our neural network is designed for real-time on-device inference and runs at over 50 FPS on a Pixel 2 phone. Our solution enables applications like AR makeup, eye tracking and AR puppeteering that rely on highly accurate landmarks for eye and lips regions. Our main contribution is a unified network architecture that achieves the same accuracy on facial landmarks as a multi-stage cascaded approach, while being 30 percent faster.
연구 동기 및 목표
- 온-디바이스 AR 애플리케이션(메이크업, Puppeteering, Eyes 추적)을 위한 고품질 3D 얼굴 메쉬 예측 동기화
- 영역별 헤드를 갖춘 통합 아키텍처 도입으로 다단계 캐스케이드를 제거
- 눈과 입술 등 중요 영역에서 높은 정확도를 달성하면서 모바일 GPU에서 실시간 성능 유지
- 의미적으로 중요한 얼굴 영역에 계산을 집중시키는 학습 가능한 주의 메커니즘 시연
제안 방법
- 256x256 이미지 입력을 처리하여 64x64 특성 맵을 생성
- 기초 서브모델을 통해 478개 전체 3D 얼굴 메쉬 랜드마크와 관심 영역의 Crop 경계 예측
- 영역 특화 서브모델을 사용하여 24x24 주의 크롭 피처에서 Eyes, Iris, Lips를 예측
- Affine 변환 θ를 사용하여 64x64 맵에서 영역 특징을 추출하는 Spatial Transformer 활용
- 두 단계로 학습: (i) 이상적인 ground-truth Crop으로의 독립 학습, (ii) 모델이 예측한 Crop으로의 학습
- 선택적으로 전체 패스를 GPU에서 수행하여 CPU-GPU 동기화를 줄이는 2단계 추론 파이프라인 포함 가능
실험 결과
연구 질문
- RQ1단일 통합 모델이 고해상도 얼굴 메쉬를 위한 캐스케이드형 지역별 랜드마크 시스템의 정확도에 맞출 수 있는가?
- RQ2Attention을 활용한 영역별 헤드를 도입하면 입술과 눈의 성능이 향상되며 전체 속도를 희생하지 않는가?
- RQ3모바일 GPU에서 엔드 투 엔드 주의 기반 메쉬를 사용할 때 온-디바이스 성능 향상은 어느 정도인가?
- RQ4Attention Mesh가 입술, 눈, 홍채 영역의 랜드마크 정확도에서 캐스케이드 모델과 비교해 어떤 차이가 있는가?
주요 결과
- Attention Mesh는 일반적인 현대 모바일 기기에서 개별 얼굴 및 영역 모델의 캐스케이드보다 25% 이상 빠르게 실행됩니다.
- Pixel 2XL의 전체 추론 시간: 16.6 ms for the full model; region submodels have 4.18 ms (Lips) and 4.70 ms (Eye & iris).
- All에 대한 평균 정규화된 2D 랜드마크 오차(3D interocular distance로 정규화): Attention Mesh의 3.11 대 Mesh 및 Cascade의 합계 2.99, Lips: 2.89 (Attention Mesh) 대 2.70 (Cascade), Eyes: 6.04 (Attention Mesh) 대 6.28 (Cascade).
- Attention Mesh는 캐스케이드에 비해 입술 영역 정확도가 경쟁력 있고 눈 영역에서도 향상된 성능을 보입니다.
- 통합 아키텍처로 학습 및 배포가 더 용이한 실시간 AR 애플리케이션(예: 립스틱 렌더링 및 Puppeteering)을 지원합니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.