[논문 리뷰] Lightweight Real-time Makeup Try-on in Mobile Browsers with Tiny CNN Models for Facial Tracking
이 논문은 실시간 얼굴 랜드마크 검출을 위한 경량화된 두 단계형 CNN 아키텍처를 제안한다. 모바일 웹 브라우저에서 작동하며, 영역의 관심(ROI) 처리를 통한 굵은 히트맵 회귀 기반으로 높은 정확도를 달성하면서도 최소한의 계산 비용을 유발한다. 제안된 방법은 자체 설계한 데이터셋에서 3.21의 정규화된 평균 제곱 오차를 기록했으며, 607KB 크기의 모델을 사용해 스마트폰에서 클라이언트 측 추론을 통해 실시간 메이크업 시연을 가능하게 한다.
Recent works on convolutional neural networks (CNNs) for facial alignment have demonstrated unprecedented accuracy on a variety of large, publicly available datasets. However, the developed models are often both cumbersome and computationally expensive, and are not adapted to applications on resource restricted devices. In this work, we look into developing and training compact facial alignment models that feature fast inference speed and small deployment size, making them suitable for applications on the aforementioned category of devices. Our main contribution lies in designing such small models while maintaining high accuracy of facial alignment. The models we propose make use of light CNN architectures adapted to the facial alignment problem for accurate two-stage prediction of facial landmark coordinates from low-resolution output heatmaps. We further combine the developed facial tracker with a rendering method, and build a real-time makeup try-on demo that runs client-side in smartphone Web browsers. More results and demo are in our project page: http://research.modiface.com/makeup-try-on-cvprw2019/
연구 동기 및 목표
- 자원이 제한된 모바일 및 웹 플랫폼에서 실시간 추론에 적합한 컴act한 얼굴 정렬 모델을 개발한다.
- 클라이언트 측 웹 애플리케이션을 위한 고정확도 랜드마크 검출과 낮은 모델 크기, 빠른 추론 속도 사이의 균형을 맞추는 데 도전한다.
- 두 단계의 굵은-세밀한 예측과 ROI 기반 특징 처리, 그리고 경량 CNN 아키텍처를 통해 모델 효율성을 최적화한다.
- 서버 측 계산 없이 저지연성과 빠른 로딩을 보장하면서도 실시간 브라우저 기반 메이크업 시연을 가능하게 한다.
- 가상의 메이크업 애플리케이션에서 흔히 발생하는 정면 및 거의 정면의 얼굴에 대해 높은 정확도를 유지한다.
제안 방법
- 두 단계형 CNN 설계: 첫 번째 단계는 굵은 랜드마크 예측을 위한 저해상도 히트맵을 생성하고, 두 번째 단계는 공유된 컨볼루션 특징에서 추출한 ROI를 사용해 좌표를 정밀하게 보정한다.
- 파라미터 수와 곱셈-덧셈 연산 수를 최소화하기 위해, MobileNetV2 기반의 역전형 잔여 블록과 깊이분리형 컨볼루션을 사용한다.
- 시그모이드 교차 엔트로피 손실과 공간 가중치가 적용된 $L_2$ 거리 손실을 사용해 경계 랜드마크의 정확도를 향상시킨다.
- 정밀한 특징 추출을 위해 RoI 앨리그를 활용하여 계산량을 줄이면서도 공간 정확도를 유지한다.
- 입력 해상도를 저해상도로 줄이고, 네트워크 채널 수를 줄이는 것(예: $α=0.5$)을 통해 추론 효율성을 최적화하면서도 정확도 저하가 크지 않게 한다.
- 학습된 랜드마크 검출기를 클라이언트 측 렲영 파이프라인에 통합하여 웹 브라우저에서 실시간 메이크업 적용을 가능하게 한다.
실험 결과
연구 질문
- RQ1자원이 제한된 모바일 기기에서 20ms 이내의 추론 시간을 유지하면서도 높은 얼굴 랜드마크 검출 정확도를 달성할 수 있는 컴팩트한 CNN 아키텍처는 가능한가?
- RQ2ROI 처리를 통한 두 단계의 굵은-세밀한 히트맵 회귀 기법은 정확도를 희생시키지 않고 계산 부담을 얼마나 효과적으로 줄일 수 있는가?
- RQ3채널 스케일링이나 입력 해상도 감소와 같은 방법으로 모델 크기를 얼마나 줄일 수 있으며, 이때도 정면 얼굴 자세에서 성능을 유지할 수 있는가?
- RQ4표준 벤치마크에서 Look at Boundary(LAB)와 같은 최신 기술과 비교했을 때, 제안된 방법은 정확도와 효율성 측면에서 어떤가?
- RQ5600KB 모델을 사용해 저지연성과 빠른 로딩을 확보하면서도 완전히 클라이언트 측에서 작동하는 브라우저 기반 메이크업 시연 시스템을 구축할 수 있는가?
주요 결과
- 전체 모델은 65개의 랜드마크를 가진 자체 설계한 데이터셋에서 3.21의 정규화된 평균 제곱 오차를 기록하여 실시간 사용에 적합한 높은 정확도를 입증했다.
- 제거 실험 결과, 히트맵 손실, $L_2$ 손실, 두 번째 처리 단계 모두가 성능 향상에 필수적임을 확인했으며, 각각 제거할 경우 정확도가 0.3~1.2점 감소했다.
- $α=0.5$(채널 수 절반)로 설정한 모델은 300W Common 서브셋에서 3.43의 오차를 유지하여 모델 압축에 대한 강건성을 입증했다.
- 모델 크기는 607KB로 축소되었고, 173.69M MAdd와 90.75M FLOPs를 기록하여 아이폰 XR에서 20ms의 추론 시간을 확보했다.
- 300W 데이터셋에서, 모델는 Common 서브셋에서 LAB(4스택)과 동일한 성능(3.42 vs. 3.42)을 보였지만, Fullset에서는 다소 떨어지는 성능(4.42 vs. 4.12)을 보여, 차폐되지 않은 정면 얼굴에 대해 더 나은 정렬 성능을 가짐을 시사한다.
- 입력 해상도와 모델 크기를 추가로 줄여도(예: 607KB) 정확도 저하가 미미하여, 모바일 및 웹 배포에 적합함을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.