Skip to main content
QUICK REVIEW

[論文レビュー] Pose2Seg: Detection Free Human Instance Segmentation

Song–Hai Zhang, Ruilong Li|arXiv (Cornell University)|Mar 28, 2018
Advanced Neural Network Applications参考文献 52被引用数 13
ひとこと要約

本論文では、人物のポーズ骨格を用いてインスタンス分離を行う、検出不要な人間インスタンスセグメンテーションフレームワークPose2Segを提案する。バウンディングボックスの代わりにポーズ骨格を用いることで、特に遮蔽されたインスタンスにおいて優れた性能を達成し、OCHumanおよびCOCOPersonベンチマークにおいて、Mask R-CNNのような検出ベース手法を上回る。

ABSTRACT

The standard approach to image instance segmentation is to perform the object detection first, and then segment the object from the detection bounding-box. More recently, deep learning methods like Mask R-CNN perform them jointly. However, little research takes into account the uniqueness of the "human" category, which can be well defined by the pose skeleton. Moreover, the human pose skeleton can be used to better distinguish instances with heavy occlusion than using bounding-boxes. In this paper, we present a brand new pose-based instance segmentation framework for humans which separates instances based on human pose, rather than proposal region detection. We demonstrate that our pose-based framework can achieve better accuracy than the state-of-art detection-based approach on the human instance segmentation problem, and can moreover better handle occlusion. Furthermore, there are few public datasets containing many heavily occluded humans along with comprehensive annotations, which makes this a challenging problem seldom noticed by researchers. Therefore, in this paper we introduce a new benchmark "Occluded Human (OCHuman)", which focuses on occluded humans with comprehensive annotations including bounding-box, human pose and instance masks. This dataset contains 8110 detailed annotated human instances within 4731 images. With an average 0.67 MaxIoU for each person, OCHuman is the most complex and challenging dataset related to human instance segmentation. Through this dataset, we want to emphasize occlusion as a challenging problem for researchers to study.

研究の動機と目的

  • 遮蔽された人間インスタンスの処理において、検出ベースのインスタンスセグメンテーションの限界を克服すること。
  • バウンディングボックスよりも優れた判別的特徴として、人間のポーズ骨格を用いてインスタンス分離を実現すること。
  • バウンディングボックスではなく、ポーズキーポイントを用いてRoIを切り出し・正規化する新しいアライメント機構(Affine-Align)を考案すること。
  • 遮蔽が顕著な人間インスタンスに焦点を当てた包括的なアノテーションを備えた新しいベンチマークデータセットOCHumanを構築し、遮蔽を主要な課題として強調すること。
  • 骨格特徴の明示的融合が、遮蔽下でも分類精度とロバスト性を向上させることを実証すること。

提案手法

  • 人間のポーズキーポイントに基づいてスケール、トランスレーション、回転、左右反転のパラメータを用い、特徴マップをアフィン変換によりアライメントする微分可能変換であるAffine-Alignを提案する。
  • 検出プロポーザルに依存しない、キーポイント座標からRoIを生成するポーズベースのRoI選択戦略を設計する。
  • キーポイントの位置と可視性を2次元ヒートマップにエンコードすることで人工的な骨格特徴を生成し、Affine-Align後に特徴マップと連結する。
  • 約50ピクセルの受容 field を持つセグメンテーションモジュール(SegModule)を用い、正確なセグメンテーションのためのグローバルなコンテキストを捉える。
  • アブレーション実験では、グランドトゥルースのバウンディングボックスとキーポイントを用いて学習し、異なるアライメント戦略および特徴融合戦略の下での性能を評価する。
  • OCHumanおよびCOCOPersonデータセットを用いて、交差エントロピー損失とDice損失を最適化し、エンドツーエンドでフレームワークを最適化する。

実験結果

リサーチクエスチョン

  • RQ1ポーズベースのインスタンスセグメンテーションフレームワークは、遮蔽された人間インスタンスの処理において、検出ベース手法を上回ることができるか?
  • RQ2バウンディングボックスベースの手法と比較して、人間のポーズ骨格をRoI選択の根拠として用いることで、インスタンス分離の精度が向上するか?
  • RQ3標準的なRoI-Alignと比較して、提案されたAffine-Alignモジュールは、複雑な人間のポーズや遮蔽に対してもどれほど効果的か?
  • RQ4特に重複や遮蔽状態にある場合に、明示的に統合された骨格特徴がセグメンテーション性能をどの程度向上させるか?
  • RQ5遮蔽された人間を焦点にした新しいベンチマークは、人間インスタンスセグメンテーションの現実世界の課題をよりよく捉えられるか?

主な発見

  • グランドトゥルースのバウンディングボックスとキーポイントを用いたPose2Segは、COCOPersonで0.582 APを達成し、検出ベースのRoI-Alignベースライン(0.568 AP)を上回った。
  • 骨格特徴融合を組み合わせたAffine-Align戦略は、OCHumanバリデーションセットで0.544 APを達成し、最良のボックスベース手法(0.497 AP)を顕著に上回った。
  • アブレーションスタディの結果、Affine-Alignと骨格特徴の組み合わせが最高の性能を示し、ポーズ特徴がインスタンスの判別に不可欠であることを示した。
  • アフィン変換による標準化のおかげで、逆さまや不自然なポーズに対してもロバストであることが確認された。
  • OCHumanデータセットには、4731枚の画像に合計8110の人物インスタンスが含まれ、平均MaxIoUは0.67であり、遮蔽された人間インスタンスセグメンテーションにおいて、これまでで最も挑戦的なベンチマークとなった。
  • フレームワークの性能は、ポーズ推定の精度に制限されるだけであり、NMS制約に縛られる検出ベースのアプローチとは異なり、これは主要な限界要因である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。