[論文レビュー] Inductive Guided Filter: Real-time Deep Image Matting with Weakly Annotated Masks on Mobile Devices
本稿では、弱いアノテーション付きマスクを入力として、軽量なアワーガラスネットワークを用いてガイドフィルタをパrameter化する、モバイルデバイス向けのリアルタイムなディープラーニングマットイング手法であるInductive Guided Filterを提案する。本手法は、強化されたテクスチャモデリングを実現するGabor損失を導入し、高い精度と高速性を達成しており、GPU上では5000 FPS以上、iPhone SEでは26ms未塔で動作し、従来手法に比べて効率性とノイズマスクへのロバスト性において優れている。
Recently, significant progress has been achieved in deep image matting. Most of the classical image matting methods are time-consuming and require an ideal trimap which is difficult to attain in practice. A high efficient image matting method based on a weakly annotated mask is in demand for mobile applications. In this paper, we propose a novel method based on Deep Learning and Guided Filter, called Inductive Guided Filter, which can tackle the real-time general image matting task on mobile devices. We design a lightweight hourglass network to parameterize the original Guided Filter method that takes an image and a weakly annotated mask as input. Further, the use of Gabor loss is proposed for training networks for complicated textures in image matting. Moreover, we create an image matting dataset MAT-2793 with a variety of foreground objects. Experimental results demonstrate that our proposed method massively reduces running time with robust accuracy.
研究の動機と目的
- モバイルデバイスへのデプロイに適したリアルタイムで効率的なディープラーニングマットイングフレームワークの開発。
- 高品質なトリマップに依存するのを減らし、弱いアノテーション付きマスクでもロバストな性能を発揮できるモデルの構築。
- 新しい損失関数により、マットイングにおけるテクスチャディティールの保持を向上。
- 2793枚の多様なフォアグラウンドオブジェクトを含む大規模な、多様性に富んだ画像マットイングデータセット(MAT-2793)の作成。
- モバイルおよびエッジデバイス上で、精度を犠牲にすることなく高い推論速度を達成すること。
提案手法
- オリジナルのガイドフィルタをパrameter化するための軽量なアワーガラスネットワークを設計し、画像とマスクの入力を用いたエンド・ツー・エンド学習を可能にした。
- モデルは、単一の軽量バックボーンを共有する二重ブランチアーキテクチャを採用し、アルファマット推定のための線形係数AとBを予測する。
- Gaborフィルタのバンドルを適用して高周波数のテクスチャ特徴を抽出し、ディティールの忠実度を向上させる、新しいGabor損失を導入した。
- 生成的対抗ネットワーク(GAN)ベースのフレームワークを用い、敵対的損失、L1損失、および提案されたGabor損失を組み合わせて、リアルな外観とディティールの向上を図った。
- 推論の高速化のため、ダウンサンプリング要因が4の高速版ガイドフィルタを採用し、オリジナルのフィルタの効率性を模倣した。
- 弱いアノテーション付きマスクは、フォアグラウンドマスクに対してランダムな拡張と収縮を施すことにより生成され、実際のユーザー入力のノイズを模倣した。
実験結果
リサーチクエスチョン
- RQ1ディープラーニングベースの手法は、モバイルデバイス上で画像マットイングのリアルタイム推論を達成できるか?
- RQ2正確なトリマップを必要とせず、弱いアノテーション付きマスクに対してもロバストな性能を発揮できるモデルはどのように構築できるか?
- RQ3Gaborフィルタに基づく新しい損失関数は、画像マットイングにおけるテクスチャディティールの保持を向上させられるか?
- RQ4軽量アーキテクチャを用いた場合、モバイルハードウェア上でどの程度の性能と速度が達成できるか?
- RQ5最先端のモデルと比較して、本手法は精度と推論遅延の両面で優れているか?
主な発見
- 提案手法は、バッチサイズ256で単一のNVIDIA V100 GPU上で5000 FPSを超える推論速度を達成し、リアルタイム性を実証した。
- iPhone SE(2016)では、1枚あたり25.9msで実行され、本番環境でもリアルタイム性能を達成した。
- ノイズのあるまたは正確でない入力マスクでも、MAT-2793およびAdobe Composition-1kデータセットの両方でロバストな性能を発揮した。
- Gabor損失は、ベースライン手法との定性的比較を通じて、テクスチャディティールの保持が著しく向上していることを示した。
- 特に弱いアノテーション付きマスクの下でも、Adobe DIMや他のSOTAモデルを上回る速度を維持しながら、競争力ある精度を達成した。
- 2793枚の多様なフォアグラウンドオブジェクトを含むMAT-2793データセットは、これまでに公開された中で最大の画像マットイングデータセットである。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。