Skip to main content
QUICK REVIEW

[論文レビュー] Lightweight Real-time Makeup Try-on in Mobile Browsers with Tiny CNN Models for Facial Tracking

Tianxing Li, Zhi Yu|arXiv (Cornell University)|Jun 5, 2019
Face recognition and analysis参考文献 23被引用数 6
ひとこと要約

本論文は、モバイルWebブラウザにおけるリアルタイム顔ランドマーク検出のための軽量で二段階のCNNアーキテクチャを提案する。粗いから細かい段階のヒートマップ回帰と領域オブイントリス(RoI)処理を用いることで、最小限の計算コストで高い精度を達成する。本手法は独自のデータセットで3.21の正規化平均二乗誤差を達成し、607KBのモデルを用いてスマートフォン上でクライアント側推論によるリアルタイムメイクトライオンを実現する。

ABSTRACT

Recent works on convolutional neural networks (CNNs) for facial alignment have demonstrated unprecedented accuracy on a variety of large, publicly available datasets. However, the developed models are often both cumbersome and computationally expensive, and are not adapted to applications on resource restricted devices. In this work, we look into developing and training compact facial alignment models that feature fast inference speed and small deployment size, making them suitable for applications on the aforementioned category of devices. Our main contribution lies in designing such small models while maintaining high accuracy of facial alignment. The models we propose make use of light CNN architectures adapted to the facial alignment problem for accurate two-stage prediction of facial landmark coordinates from low-resolution output heatmaps. We further combine the developed facial tracker with a rendering method, and build a real-time makeup try-on demo that runs client-side in smartphone Web browsers. More results and demo are in our project page: http://research.modiface.com/makeup-try-on-cvprw2019/

研究の動機と目的

  • リソース制約のあるモバイルおよびWebプラットフォームでリアルタイム推論に適したコンactな顔アライメントモデルの開発。
  • クライアント側Webアプリケーションにおける、高いランドマーク検出精度と小さなモデルサイズ、高速な推論速度のバランスをとる課題に対処する。
  • 二段階の粗いから細かい予測とRoIベースの特徴処理、および軽量なCNNアーキテクチャを用いてモデル効率を最適化する。
  • サーバー側計算を一切行わず、低遅延かつ高速ロードを実現するリアルタイムのブラウザベースのメイクトライオンを可能にする。
  • バーチャルトライオンアプリケーションで一般的な正面およびやや正面の顔に対して高い精度を維持する。

提案手法

  • 二段階のCNNを設計:第一段階は粗いランドマーク予測のための低解像度ヒートマップを生成し、第二段階は共有畳み込み特徴から抽出したRoIを用いて座標を精緻化する。
  • パrameter数と乗加算演算数を最小限に抑えるために、MobileNetV2を模倣した逆残差ブロックと深度分離畳み込みを採用する。
  • シグモイド交差エントロピー損失と空間重み付き$L_2$距離損失を用いてヒートマップ回帰を実施し、境界付近のランドマークの精度を向上させる。
  • 正確な特徴抽出を実現するため、RoIアライグを採用し、計算量を削減しながらも空間的精度を維持する。
  • 入力解像度の低減とネットワークチャネル数の削減(例:$α=0.5$)により推論を最適化し、精度の著しい低下を伴わずに実現する。
  • トレーニング済みのランドマーク検出器をクライアント側レンダリングパイプラインに統合し、Webブラウザ上でリアルタイムのメイク適用を実現する。

実験結果

リサーチクエスチョン

  • RQ1コンパクトなCNNアーキテクチャは、モバイルデバイスで20ms未満の推論時間を維持しながら、高い顔ランドマーク検出精度を達成できるか?
  • RQ2RoI処理を用いた二段階の粗いから細かいヒートマップ回帰は、精度を損なわせることなく計算負荷を低減できるか?
  • RQ3チャネルスケーリングや入力解像度の低減などの手法により、モデルサイズをどれほど小さくできるか? また、正面顔ポーズでのパフォーマンスはどの程度維持できるか?
  • RQ4標準ベンチマークにおいて、Look at Boundary(LAB)のような最先端モデルと比較して、本手法の精度と効率性はどの程度か?
  • RQ5600KBのモデルを用いて、完全にクライアント側で動作するブラウザベースのメイクトライオンシステムを、低遅延かつ高速ロードで構築できるか?

主な発見

  • 完全なモデルは、65個のランドマークを持つ独自データセットで3.21の正規化平均二乗誤差を達成し、リアルタイム利用に適した高い精度を示した。
  • アブレーションスタディにより、ヒートマップ損失、$L_2$損失、および第二段階処理の各要素が不可欠であることが確認され、いずれかを削除すると性能が0.3~1.2ポイント低下した。
  • チャネル数を半分($α=0.5$)にしたモデルでも、300W Commonサブセットで3.43の誤差を維持し、モデル圧縮に強いことが示された。
  • モデルサイズは607KBにまで削減され、173.69M MAddと90.75M FLOPsを達成し、iPhone XRで20msの推論が可能になった。
  • 300Wデータセットでは、LAB(4スタック)と同等の性能をCommonサブセット(3.42 vs. 3.42)で示したが、Fullsetではわずかに劣る(4.42 vs. 4.12)ことが判明し、露出した正面顔のアライメント性能が優れていることが示された。
  • 入力解像度とモデルサイズのさらなる低減(例:607KB)によっても、精度の低下は最小限に抑えられ、モバイルおよびWebデプロイメントに適していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。