Skip to main content
QUICK REVIEW

[論文レビュー] Boosting Semantic Human Matting with Coarse Annotations

Jinlin Liu, Yuan Yao|arXiv (Cornell University)|Apr 10, 2020
Image Enhancement Techniques参考文献 33被引用数 9
ひとこと要約

本論文は、トリマップを必要とせず、エンドツーエンドのセマンティック・ヒューマン・マッティングを向上させるために、粗いと細かい人間のアノテーションの両方を活用する新しいフレームワークを提案する。ハイブリッドデータ上でマスク予測ネットワークを訓練し、品質統一ネットワークを適用してマスク品質を標準化し、マッティング精錬ネットワークで結果を精錬することで、高価な高品質アノテーションの必要を著しく削減しながら、最先端の性能を達成する。

ABSTRACT

Semantic human matting aims to estimate the per-pixel opacity of the foreground human regions. It is quite challenging and usually requires user interactive trimaps and plenty of high quality annotated data. Annotating such kind of data is labor intensive and requires great skills beyond normal users, especially considering the very detailed hair part of humans. In contrast, coarse annotated human dataset is much easier to acquire and collect from the public dataset. In this paper, we propose to use coarse annotated data coupled with fine annotated data to boost end-to-end semantic human matting without trimaps as extra input. Specifically, we train a mask prediction network to estimate the coarse semantic mask using the hybrid data, and then propose a quality unification network to unify the quality of the previous coarse mask outputs. A matting refinement network takes in the unified mask and the input image to predict the final alpha matte. The collected coarse annotated dataset enriches our dataset significantly, allows generating high quality alpha matte for real images. Experimental results show that the proposed method performs comparably against state-of-the-art methods. Moreover, the proposed method can be used for refining coarse annotated public dataset, as well as semantic segmentation methods, which reduces the cost of annotating high quality human data to a great extent.

研究の動機と目的

  • 高品質なヒューマン・アルファマットのアノテーションにかかる高コストと困難さ、特にヘアのような細部のアノテーションを軽減すること。
  • セマンティック・ヒューマン・マッティングにおいて、高価でユーザーインタラクティブなトリマップへの依存を減らすこと。
  • 収集が容易な粗いアノテーションデータセットを活用してマッティング性能を向上させること。
  • 明示的なトリマップの監視なしに、低品質または粗いマスクから高品質なマッティングを実現するフレームワークを開発すること。
  • 公開の粗いアノテーションデータセットやセマンティックセグメンテーション出力を正確なアルファマットに精錬する実用的ソリューションを提供すること。

提案手法

  • 細かいおよび粗いヒューマン・アノテーションのハイブリッドデータセット上で訓練されたマスク予測ネットワーク(MPN)が、低解像度のセマンティック・マスクを予測する。
  • MPNの出力を多様な入力画像全体で品質を統一するための品質統一ネットワーク(QUN)が導入され、最終精錬のための一貫性のある入力を保証する。
  • 統一された粗いマスクと元の画像を入力として受け取り、最終的な高精度なアルファマットを予測するマッティング精錬ネットワーク(MRN)が採用される。
  • MPNとQUNは粗いおよび細かいデータの両方で訓練されるが、MRNは細かいアノテーションデータにのみ特化して訓練され、詳細の忠実度を保つ。
  • このフレームワークは、既存の粗いアノテーションデータセットやセマンティックセグメンテーション出力と互換性があり、エンドツーエンドの精錬を可能にする。
  • 本手法は三段階パイプラインを採用する:粗いマスク予測 → 品質標準化 → 高解像度マッティング精錬。トリマップ入力は一切不要である。

実験結果

リサーチクエスチョン

  • RQ1トリマップを必要とせずに、粗いアノテーションデータを効果的に活用してセマンティック・ヒューマン・マッティングの性能を向上させることができるか?
  • RQ2粗いマスクに見られる品質のばらつきをどのように統一し、頑健なマッティング精錬を可能にするか?
  • RQ3限られた細かいデータで訓練されたモデルが、豊富な粗いデータを組み合わせることで、十分に一般化できるか?
  • RQ4本手法が、低品質な公開アノテーションやセグメンテーション出力をどれほど高品質なアルファマットに精錬できるか?
  • RQ5品質統一ネットワーク(QUN)は、直接的な粗いマスクの精錬に比べて、マッティング性能を著しく向上させるか?

主な発見

  • 提案手法は、トリマップを入力としなくても、セマンティック・ヒューマン・マッティング分野で最先端の性能を達成した。
  • 表2の定量的指標から、細かいアノテーションデータのみで訓練する場合と比較して、粗いアノテーションデータの組み込みが性能を顕著に向上させたことが示された。
  • 品質統一ネットワーク(QUN)は、頑健なマッティングに不可欠であり、QUNを除去すると性能が顕著に低下することが、表1の指標で確認された。
  • 本手法はPASCAL や COCO などの公開データセットからの粗いマスクを効果的に精錬し、ヘアのような困難な細部に対しても高品質なアルファマットを生成できた。
  • DeepLab などのセマンティックセグメンテーションモデルの出力を効果的に改善し、元の予測で欠落していた細粒度の詳細を回復できた。
  • 細かいおよび粗いアノテーションを組み合わせた収集済みハイブリッドデータセットにより、実世界の多様な画像にわたる一般化性能が向上したことが、図7で示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。