Skip to main content
QUICK REVIEW

[論文レビュー] Keypoint Based Weakly Supervised Human Parsing

Zhonghua Wu, Guosheng Lin|arXiv (Cornell University)|Sep 14, 2018
Advanced Neural Network Applications参考文献 17被引用数 3
ひとこと要約

本稿では、高価なピクセル単位のラベルではなく、オブジェクトのキーポイントアノテーションのみを用いて、競争力のある性能を達成する弱教師付き人体パーセプション手法を提案する。反復的な疑似マスク生成プロセスと相関ネットワークを用いた部分-オブジェクト同時セグメンテーションにより、ラベル付け作業を軽減しつつ、完全教師ありの結果に匹敵する性能を達成し、性能低下は約10%にとどまる。

ABSTRACT

Fully convolutional networks (FCN) have achieved great success in human parsing in recent years. In conventional human parsing tasks, pixel-level labeling is required for guiding the training, which usually involves enormous human labeling efforts. To ease the labeling efforts, we propose a novel weakly supervised human parsing method which only requires simple object keypoint annotations for learning. We develop an iterative learning method to generate pseudo part segmentation masks from keypoint labels. With these pseudo masks, we train an FCN network to output pixel-level human parsing predictions. Furthermore, we develop a correlation network to perform joint prediction of part and object segmentation masks and improve the segmentation performance. The experiment results show that our weakly supervised method is able to achieve very competitive human parsing results. Despite our method only uses simple keypoint annotations for learning, we are able to achieve comparable performance with fully supervised methods which use the expensive pixel-level annotations.

研究の動機と目的

  • 人体パーセプションにおけるピクセル単位のラベルの高コストな人的ラベル付けを、オブジェクトキーポイントアノテーションのみを用いた監視によって低減すること。
  • スパarsなキーポイントアノテーションから高品質な疑似セグメンテーションマスクを生成し、完全畳み込みネットワーク(FCN)を学習する手法を開発すること。
  • 部分とオブジェクトセグメンテーションの強い相関関係を共同学習によってモデル化することで、部分セグメンテーションの性能を向上させること。
  • 人間によるアノテーションとモデル予測の両方のキーポイント(例:Mask R-CNN や AlphaPose からの予測)を用いて学習可能とし、実用的応用性を高めること。
  • キーポイント監視による弱教師付き学習が、完全教師あり手法に近い性能を達成できることを示すこと。

提案手法

  • キーポイントアノテーションを用いて、グラフカットベースの疑似マスク生成のための初期の前景領域と背景領域を定義する。前景領域はキーポイントアノテーションとその接続関係に基づく。
  • キーポイント制約を用いて、FCNの予測とグラフカット最適化を交互に繰り返す反復的リファインメントプロセスを適用し、疑似マスクの品質を向上させる。
  • 生成された疑似マスクを用いて、VGG-16バックボーンを搭載したDeepLabベースのFCNを学習する。オブジェクト、部分、およびリファインド部分セグメンテーションの損失関数を等価な重みで最適化する。
  • 部分とオブジェクト予測の間の相互作用をモデル化するため、ネットワーク内に相関ブロックを導入し、セグメンテーションの一貫性と正確性を向上させる。
  • 推論時におけるキーポイント予測(例:Mask R-CNN や AlphaPose からの予測)をグラフカット最適化に統合し、セグメンテーション結果をさらに精緻化する。
  • グラフカットの細粒度と安定性を向上させるために、最小成分サイズが60のスーパーピクセルセグメンテーションを用いる。

実験結果

リサーチクエスチョン

  • RQ1ピクセル単位のマスクではなく、オブジェクトキーポイントアノテーションのみを用いて、人体パーセプションを効果的に学習できるか?
  • RQ2スパースなキーポイントアノテーションを高品質な監視情報に変換する反復的疑似マスク生成手法は、セマンティックセグメンテーションのための有効な手法か?
  • RQ3部分とオブジェクトセグメンテーションを同時に学習することで、独立した予測と比較して、パーセプション性能がどの程度向上するか?
  • RQ4提案手法は、Mask R-CNN や AlphaPose などの事前学習済み検出器から得られる低品質なキーポイント予測に対しても一般化可能か?
  • RQ5推論時におけるキーポイント予測を統合することで、セグメンテーションの正確性がさらに向上するか?

主な発見

  • 提案手法は、PASCAL VOC Human Part データセットにおいて、同じVGG-16バックボーンを用いた完全教師ありベースラインと比較して、約10%の性能低下で平均IoU 67.8%を達成した。
  • 疑似マスクの反復的リファインメントによりIoU性能が向上し、3回の反復後に収束することが確認され、効果的なマスクリファインメントが実現していることが示された。
  • 部分とオブジェクトセグメンテーションの共同学習のための相関ブロックは、部分セグメンテーションのIoUを向上させ、相互依存性をモデル化することでセグメンテーションの正確性が向上することを実証した。
  • 本手法は、人間によるアノテーション(例:PASCAL VOC Human Pose)および事前学習済み検出器(例:Mask R-CNN や AlphaPose)からのキーポイントアノテーションを効果的に活用でき、精度がやや低いキーポイント入力に対しても競争力ある結果を達成した。
  • グラフカット最適化を介して推論時におけるキーポイント予測を統合することで、顕著な性能向上が得られ、動的キーポイント統合の価値が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。