Skip to main content
QUICK REVIEW

[論文レビュー] Pose-Aware Person Recognition

Vijay Kumar, Anoop Namboodiri|arXiv (Cornell University)|May 29, 2017
Face recognition and analysis参考文献 40被引用数 8
ひとこと要約

本稿では、複数の身体領域における同時最適化とポーズに配慮した統合手法を用いて、極端なポーズ変動下でも性能を向上させるポーズに配慮した人物認識フレームワークを提案する。本手法は、写真アルバム、映画、スポーツ動画を含む多様なベンチマークで最先端の性能を達成しており、PIPAではrank-1正解率96.56%、Hannahでは84.83%、Soccerでは63.2%を達成している。

ABSTRACT

Person recognition methods that use multiple body regions have shown significant improvements over traditional face-based recognition. One of the primary challenges in full-body person recognition is the extreme variation in pose and view point. In this work, (i) we present an approach that tackles pose variations utilizing multiple models that are trained on specific poses, and combined using pose-aware weights during testing. (ii) For learning a person representation, we propose a network that jointly optimizes a single loss over multiple body regions. (iii) Finally, we introduce new benchmarks to evaluate person recognition in diverse scenarios and show significant improvements over previously proposed approaches on all the benchmarks including the photo album setting of PIPA.

研究の動機と目的

  • 顔が隠されたり利用不可な状況を含め、全身の人物認識において極端なポーズや視点の変化に直面する課題に対処すること。
  • ポーズに依存しない表現やポーズ正規化手法の限界を克服し、視点に特化した判別性の高い身体部位特徴を学習すること。
  • ポーズの多様性が高く、正面視点が稀な映画やスポーツ動画などの実世界のシナリオにおける認識の頑健性を向上させること。
  • 先行研究が主に限定された写真アルバムの設定にとどまるのに対し、写真アルバム、映画、スポーツの複数のドメインを統合的に評価するフレームワークを構築すること。
  • 推定されたポーズの尤度に基づいて分類器出力を動的に重み付けするポーズに配慮した統合戦略を導入し、多様なポーズ下での認識性能を向上させること。

提案手法

  • ポーズ空間を離散的なクラスタ(例:正面、半側面、側面、背面)に分割し、視点に特化した複数部位の畳み込みニューラルネットワーク(PSM)を訓練する。
  • 共通のネットワークアーキテクチャを用いて、頭部および上半身などの複数部位において、1つの識別損失を同時に最適化することで、柔軟な特徴利用を可能にする。
  • 推論時にポーズ推定器を用いて各ポーズクラスの尤度を予測し、分類器スコアの統合に使用するポーズに配慮した重みを生成する。
  • 複数のポーズ特化モデルとベースモデルの予測を、ポーズ推定器の出力から導出された重みを用いた重み付き平均で統合する。
  • ネットワークの最終層から深層特徴(例:fc7特徴)を抽出し、連結とプーリング戦略を用いて次元を低減する。
  • 予測スコアにl2正規化を適用し、オープンセット認識シナリオにおける未知のアイデンティティの信頼性に基づく除外を可能にする。

実験結果

リサーチクエスチョン

  • RQ1顔が隠されたり利用不可な状況を含め、全身の人物認識において極端なポーズや視点の変化に直面する課題に対処すること。
  • RQ2ポーズに依存しない表現やポーズ正規化手法の限界を克服し、視点に特化した判別性の高い身体部位特徴を学習すること。
  • RQ3ポーズの多様性が高く、正面視点が稀な映画やスポーツ動画などの実世界のシナリオにおける認識の頑健性を向上させること。
  • RQ4先行研究が主に限定された写真アルバムの設定にとどまるのに対し、写真アルバム、映画、スポーツの複数のドメインを統合的に評価するフレームワークを構築すること。
  • RQ5推定されたポーズの尤度に基づいて分類器スコアの重みを動的に調整するポーズに配慮した統合戦略が、多様なポーズ下での認識性能を向上させるか。

主な発見

  • 提案されたポーズに配慮したフレームワークは、写真アルバム設定のPIPAデータセットでrank-1正解率96.56%を達成し、先行手法を顕著に上回っている。
  • より困難なHannahデータセット(映画ドメイン)では、rank-1正解率84.83%を達成しており、多様で非正面のポーズに対しても頑健であることが示された。
  • 背面視の割合が高いとされるサッカー・データセットでは、rank-1正解率63.2%を達成し、ポーズの不均衡にもかかわらずベースライン手法を上回った。
  • 学習された重みを用いたポーズに配慮した統合は、平均プーリングや他のアンサンブル戦略を上回り、Hannahデータセットではrank-1とrank-2の正解率差が12%に達しており、上位予測の信頼性が非常に高いことが示された。
  • 未知のインスタンスの除外能力が優れており、受信器特性曲線(ROC AUC)スコアから、ポーズに配慮した表現からの正規化済み予測スコアが、分布外サンプルの検出により信頼性があることが示された。
  • 最終的な特徴次元は約18,384 × 8 = 147,072であり、PIPERより約3倍小さく、naeilより約2倍大きいが、16,000次元の特徴ベクトルを用いたnaeilよりも高い正解率を達成している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。