Skip to main content
QUICK REVIEW

[論文レビュー] Towards Real-Time Automatic Portrait Matting on Mobile Devices

Seokjun Seo, Seungwoo Choi|arXiv (Cornell University)|Apr 8, 2019
Advanced Image and Video Retrieval Techniques参考文献 34被引用数 4
ひとこと要約

本稿では、マルチブランチの拡張畳み込みと線形ボトルネックブロックを用いた、モバイルデバイス向けの軽量でリアルタイムなポートレートマットイングモデルMMNetを提案する。Xiaomi Mi 5では30 FPSを達成し、最先端のモデルと比較してわずか15%高い勾配誤差を示すが、Mobile DeepLabv3と比較して1桁分少ないパラメータ数を用いている。

ABSTRACT

We tackle the problem of automatic portrait matting on mobile devices. The proposed model is aimed at attaining real-time inference on mobile devices with minimal degradation of model performance. Our model MMNet, based on multi-branch dilated convolution with linear bottleneck blocks, outperforms the state-of-the-art model and is orders of magnitude faster. The model can be accelerated four times to attain 30 FPS on Xiaomi Mi 5 device with moderate increase in the gradient error. Under the same conditions, our model has an order of magnitude less number of parameters and is faster than Mobile DeepLabv3 while maintaining comparable performance. The accompanied implementation can be found at \url{https://github.com/hyperconnect/MMNet}.

研究の動機と目的

  • モバイルデバイス上で自動ポートレートマットイングのリアルタイム推論を達成する挑戦に応えること。
  • マットイング品質を損なわずにモデルサイズと計算コストを低減すること。
  • トリマップやスクリッチなどのユーザーインタラクティブ入力を必要とする従来の手法の制限を克服すること。
  • 厳密な遅延およびパラメータ制約下でも高いパフォーマンスを維持するコンactなニューラルネットワークを開発すること。
  • 写真編集や動画処理などの実用的モバイルアプリケーションへのリアルタイムポートレートマットイングの導入を可能にすること。

提案手法

  • 空間的詳細を保持するためにスキップ接続を備えたエンコーダデコーダアーキテクチャを採用する。
  • FLOPsとモデルサイズを削減するため、基本的な演算として深度可分畳み込みを採用する。
  • 異なる拡張率を有するマルチブランチの拡張畳み込みを導入し、マルチスケールの文脈を効率的に捉える。
  • 表現力の向上を図りつつ効率性を維持するため、線形ボトルネックブロックを採用する。
  • 幅乗数を適用して、モデル容量、遅延、パラメータ数を制御し、モバイルデプロイメントに適応する。
  • アルファマットの品質を向上させるために、新しい勾配損失と複数の補助損失を導入する。

実験結果

リサーチクエスチョン

  • RQ1コンパクトなニューラルネットワークは、顕著な性能低下を伴わずにモバイルデバイス上でリアルタイムのポートレートマットイングを達成できるか?
  • RQ2線形ボトルネックブロックを併せ持つマルチブランチの拡張畳み込みは、精度と効率のバランスをどの程度効果的に実現できるか?
  • RQ3モバイルハードウェア上でのモデルサイズ、遅延、マットイング品質のトレードオフはどのようなものか?
  • RQ4量子化とモデル圧縮は、精度損失を最小限に抑えながら推論速度をどの程度向上できるか?
  • RQ5提案されたアーキテクチャは、ポートレートマットイングを越えて、他の画像マットイングや動画マットイングのタスクにも一般化可能か?

主な発見

  • MMNetはXiaomi Mi 5で30 FPSを達成し、最先端のモデルと比較してわずか15%高い勾配誤差を示すが、リアルタイム性能を実現している。
  • Mobile DeepLabv3と比較して1桁分少ないパラメータ数を用いながらも、同等のパフォーマンスを維持している。
  • 8ビットへの量子化により遅延が25%低下し、勾配誤差もわずかに改善され、低精度推論に対する頑健性が示された。
  • アブレーションスタディにより、マルチブランチの拡張畳み込みと線形ボトルネックブロックがパフォーマンスと効率性において不可欠であることが確認された。
  • MMNetは、モバイルデバイス上での遅延、パラメータ数、勾配誤差のパラメータフロント上、すべての先行手法を上回った。
  • 実装はhttps://github.com/hyperconnect/MMNetにて公開されており、再現性とさらなる開発を可能としている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。