[論文レビュー] Weakly and Semi Supervised Human Body Part Parsing via Pose-Guided Knowledge Transfer
本論文は、キーポイントベースのポーズマッチングを通じて、ソース人物の部分セグメンテーションアノテーションをターゲット人物にポーズガイドド知識移行することで、弱教師ありおよび半教師ありの人体部品パーセプトリング手法を提案する。解剖学的類似性を活用して、合成された高密度セグメンテーションラベルを生成することで、PASCAL-Person-Partで強教師ありベースラインを上回る6 mIOUの向上を達成し、新たなSOTA性能を確立した。
Human body part parsing, or human semantic part segmentation, is fundamental to many computer vision tasks. In conventional semantic segmentation methods, the ground truth segmentations are provided, and fully convolutional networks (FCN) are trained in an end-to-end scheme. Although these methods have demonstrated impressive results, their performance highly depends on the quantity and quality of training data. In this paper, we present a novel method to generate synthetic human part segmentation data using easily-obtained human keypoint annotations. Our key idea is to exploit the anatomical similarity among human to transfer the parsing results of a person to another person with similar pose. Using these estimated results as additional training data, our semi-supervised model outperforms its strong-supervised counterpart by 6 mIOU on the PASCAL-Person-Part dataset, and we achieve state-of-the-art human parsing results. Our approach is general and can be readily extended to other object/animal parsing task assuming that their anatomical similarity can be annotated by keypoints. The proposed model and accompanying source code are available at https://github.com/MVIG-SJTU/WSHP
研究の動機と目的
- ディープラーニングベースのパーセプトリングモデルの性能を制限する、高密度にアノテートされた人体部品セグメンテーションデータの不足に取り組む。
- 人間同士の解剖学的およびポーズ類似性を活用して、少数の完全アノテート済み人物から多数の弱教師ありアノテート済み人物へ、部分セグメンテーションアノテーションを転送する。
- スパarsなキーポイントアノテーションを高密度セマンティックセグメンテーションの強力な事前知識として用いる汎用的なフレームワークを開発する。
- ポーズガイドド転送により生成された合成データが、ノイズのあるキーポイント推定でさえも、モデルの一般化性能と性能を顕著に向上させることを実証する。
- キーポイントアノテーションが利用可能な他のオブジェクトカテゴリ(例:馬や牛)へも、本手法を拡張可能であることを示す。
提案手法
- キーポイントベースのポーズマッチングを用いて、ターゲット人物と類似ポーズを持つソース人物を同定する。
- 最も類似したソース人物からターゲット人物へ部分セグメンテーションアノテーションを転送し、ポーズ整合的な部分レベルの事前知識を形成する。
- 複数の類似ソースからのアノテーションを平均化することで、ノイズ低減と信頼性向上を図る。
- 入力画像と転送された部分レベル事前知識を入力として、高品質な高密度セグメンテーション予測を生成するリファインメントネットワークを用いる。
- リファインメントされたセグメンテーションを合成学習データとして用い、半教師あり学習スキームでパーセプトリングネットワークを監視する。
- 最先端のポーズ推定器から得られる推定ポーズを用いても、強い性能を示すことで、ノイズのあるキーポイント予測に対しても本フレームワークのロバスト性を示している。
実験結果
リサーチクエスチョン
- RQ1スパarsなキーポイントアノテーションは、人体部品パーセプトリングの高品質な合成高密度セグメンテーションラベルを効果的に生成するために活用可能か?
- RQ2解剖学的に類似した人物からのポーズガイドド知識転送は、弱教師ありおよび半教師ありパーセプトリングにおける一般化性能と性能を向上させるか?
- RQ3学習データが限られた状況下でも、本手法は完全教師ありベースラインを上回るか?
- RQ4実世界のポーズ推定器から得られるノイズのあるキーポイント予測に対しても、本手法はロバストか?
- RQ5キーポイントアノテーションが利用可能な場合、本手法は人間を超えて他のオブジェクトカテゴリ(例:馬や牛)へも一般化可能か?
主な発見
- 半教師ありモデルは、PASCAL-Person-Partデータセットで強教師ありベースラインを6 mIOU上回り、以前のSOTA結果を上回った。
- VGG-16バックボーンを用いた場合、ResNet-101ベースの強教師ありモデルを上回り、知識転送戦略の有効性を示した。
- マルチスケールテストを用いることで、67.6 mIOUを達成し、以前の最高結果より3 mIOU向上した。
- ポーズ推定結果(例:COCOでMPIIで訓練されたモデル)を用いた場合、真値キーポイントアノテーションで訓練された結果と同等の61.8 mIOUを達成し、ノイズに強いことを示した。
- Horse-Cowデータセットでは、馬と牛の両方でmIOUがそれぞれ3.14および3.39向上し、ResNet-101バックボーンを用いることで76.99および74.22 mIOUを達成し、新たなSOTA結果を樹立した。
- 定性的な結果から、リファインメントネットワークがよりタイトで正確なマスクを生成し、構造的エラーを低減していることが示され、これが主パーセプトリングネットワークの性能向上に寄与している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。