[論文レビュー] Fast Deep Matting for Portrait Animation on Mobile Phone
本稿では、軽量な完全畳み込みネットワークに密接接続と拡張畳み込みを組み合わせ、粗い二値マスクを生成した後、エッジを保持するマットリング適応型ガイドフィルタを適用する学習可能フィーバリングブロックを用いて、リアルタイムで自動的に高品質なアルファマットを生成する、モバイル向けポートレートアニメーション用のリアルタイムで自動化されたディープマッティング手法を提案する。本システムは、モバイルデバイスで15 fpsを達成し、最先端の手法と同等の性能を発揮する。これにより、ユーザーの操作なしにリアルタイムでのポートレートアニメーションが可能になる。
Image matting plays an important role in image and video editing. However, the formulation of image matting is inherently ill-posed. Traditional methods usually employ interaction to deal with the image matting problem with trimaps and strokes, and cannot run on the mobile phone in real-time. In this paper, we propose a real-time automatic deep matting approach for mobile devices. By leveraging the densely connected blocks and the dilated convolution, a light full convolutional network is designed to predict a coarse binary mask for portrait images. And a feathering block, which is edge-preserving and matting adaptive, is further developed to learn the guided filter and transform the binary mask into alpha matte. Finally, an automatic portrait animation system based on fast deep matting is built on mobile devices, which does not need any interaction and can realize real-time matting with 15 fps. The experiments show that the proposed approach achieves comparable results with the state-of-the-art matting solvers.
研究の動機と目的
- ユーザーの操作なしにモバイルデバイス上でリアルタイムの画像および動画マッティングを実現すること。
- トリマップやストロークを必要とするインタラクティブマッティング手法の限界を克服し、モバイルデプロイに適した高速性を実現すること。
- 高速かつ高精度なモバイル推論に適した、軽量でエンドツーエンドのディープラーニングフレームワークを構築すること。
- 既存の手法が困難であるとされる髪や首の複雑な領域を正確にマッティングすること。
- モバイルハードウェア上でリアルタイムに動作する完全自動のポートレートアニメーションシステムを構築すること。
提案手法
- ポートレート画像から粗い二値マスクを予測するために、密接接続ブロックと拡張畳み込みを組み合わせた軽量な完全畳み込みネットワークが用いられる。
- ネットワークはエンドツーエンドで訓練され、前景と背景をセグメンテーションする。ダウンサンプリングにより計算負荷を低減する。
- 新規に導入されたフィーバリングブロックは、マットリング適応型の重みを学習するガイドフィルタを用いて、二値マスクを滑らかでエッジを保持するアルファマットに精錬する。
- フィーバリングブロックは、トレーニング時に学習されたフィルタ重みを用いて粗いマスクに対して線形変換を実行するため、高速な推論が可能である。
- GPUおよびCPU推論を活用してモバイルデプロイに最適化され、Androidでのレンダースクリプト最適化によりさらなる高速化が図られている。
- 本システムは、モバイル端末向けリアルタイムポートレートアニメーションアプリケーションに統合され、15 fpsで画像を処理している。
実験結果
リサーチクエスチョン
- RQ1エンドツーエンドの自動化されたディープラーニング手法が、ユーザーの操作なしにモバイルデバイス上でリアルタイムマッティングを達成できるか?
- RQ2密接接続と拡張畳み込みを備えた軽量ネットワークが、ポートレート画像に対して正確な粗いセグメンテーションを生成できるか?
- RQ3学習可能なエッジ保持型ガイドフィルタが、二値マスクを高品質なアルファマットに効果的に精錬できるか?
- RQ4本手法は、モバイルハードウェア上で既存の最先端マッティングソルバーよりも速度と精度で優れているか?
- RQ5本手法は、既存の自動マッティング技術よりも、背景色が似通った領域や髪の毛や襟、肩といった繊細なディテールをより高精度に処理できるか?
主な発見
- 提案手法は、モバイルデバイスで15 fpsを達成し、ユーザーの操作なしにリアルタイムのポートレートアニメーションを実現した。
- Qualcomm Snapdragon 820を用いた場合、GPUでは62ms、CPUでは140msで実行され、優れたモバイル効率性を示した。
- Shenら(2016b)のベースライン自動マッティング手法と比較して、GPUでは587ms、CPUでは5962msの推論時間短縮を達成した。
- 最先端のベースラインと比較して勾配誤差がわずか4.37×10⁻³増加に抑えられ、同等のマッティング品質を示した。
- 複雑なケース、例えば背景色が似通った領域や、襟や肩の繊細なディテールにおいて、リアルタイムアプリ「Fabby」を上回る性能を発揮した。
- フィーバリングブロックはマットリング適応的挙動を示し、頭部と首の領域を正確に分離可能であり、これは他の手法では稀な特徴である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。