Skip to main content
QUICK REVIEW

[論文レビュー] Hierarchical Invariant Feature Learning with Marginalization for Person Re-Identification

Rahul Rama Varior, Gang Wang|arXiv (Cornell University)|Nov 30, 2015
Video Surveillance and Tracking Methods参考文献 41被引用数 3
ひとこと要約

本稿では、人物再識別を目的とした階層的不変特徴学習フレームワークを提案し、マージナル化を組み込む。ラベル付き画像ペairを用いて、カーネル空間内でのポーズおよび照明不変特徴を学習する。SVMメトリック学習にマージナル化を統合することで、明示的なデータ拡張なしにVIPeR、CUHK01、CAVIAR4REID、iLIDSで最先端の性能を達成し、小規模データセットにおける一般化性能を向上させる。

ABSTRACT

This paper addresses the problem of matching pedestrians across multiple camera views, known as person re-identification. Variations in lighting conditions, environment and pose changes across camera views make re-identification a challenging problem. Previous methods address these challenges by designing specific features or by learning a distance function. We propose a hierarchical feature learning framework that learns invariant representations from labeled image pairs. A mapping is learned such that the extracted features are invariant for images belonging to same individual across views. To learn robust representations and to achieve better generalization to unseen data, the system has to be trained with a large amount of data. Critically, most of the person re-identification datasets are small. Manually augmenting the dataset by partial corruption of input data introduces additional computational burden as it requires several training epochs to converge. We propose a hierarchical network which incorporates a marginalization technique that can reap the benefits of training on large datasets without explicit augmentation. We compare our approach with several baseline algorithms as well as popular linear and non-linear metric learning algorithms and demonstrate improved performance on challenging publicly available datasets, VIPeR, CUHK01, CAVIAR4REID and iLIDS. Our approach also achieves the stateof-the-art results on these datasets.

研究の動機と目的

  • 変動する照明、ポーズ、環境条件下における人物再識別の課題に対処すること。
  • 人物再識別における小規模なラベル付きデータセットの制限を克服し、限られたデータからの有効な一般化を実現すること。
  • ラベル付き画像ペアを用いて、カメラビュー間での不変表現を捉える特徴学習フレームワークを開発すること。
  • メトリック学習にマージナル化を統合し、明示的なノイズまたは損傷のある入力を暗黙的に処理すること。
  • より高いロバストネスと一般化性能を実現するため、ベンチマークデータセットで最先端の性能を達成すること。

提案手法

  • 非線形カーネル関数を用いて、画像から局所特徴を抽出し、カーネル空間にマップする。
  • 一致する画像ペアの対応する部分に対して不変性を強制するため、カーネル空間で線形変換を学習する。
  • マージナル化されたマップされた局所特徴を連結することで、グローバルな画像表現を構築する。
  • ノイズや損傷のある入力を暗黙的に処理できるように、SVMメトリック学習(SVMML)をマージナル化を組み込んで変更する。
  • 分類性能の向上を図るため、マージナル化された特徴をメトリック学習フレームワークの入力として使用する。
  • ラベル付き画像ペアを用いて、階層的ネットワークをエンドツーエンドで訓練し、個人間の類似性と個人内不変性を最適化する。

実験結果

リサーチクエスチョン

  • RQ1階層的特徴学習フレームワークは、カメラビュー間での不変表現を効果的に学習できるか?
  • RQ2メトリック学習におけるマージナル化は、訓練データが限られた場合の一般化をどのように向上させるか?
  • RQ3カーネルベースの特徴マッピングとマージナル化されたメトリック学習を組み合わせることで、標準ベンチマークで既存の最先端手法を上回る性能が得られるか?
  • RQ4提案されたフレームワークは、ポーズ、照明、環境の変化に対する感受性をどの程度低減するか?
  • RQ5マージナル化技術は、計算コストを増加させることなく、データ拡張の利点を模倣できるか?

主な発見

  • 提案手法は、VIPeRデータセットでRank-1正解率47.9%を達成し、すべての先行研究を上回った。
  • CAVIAR4REIDデータセットでは、kLFDAと組み合わせた場合、Rank-1正解率45.1%を達成し、MFAを除くすべての手法を上回った。
  • iLIDSデータセットでは、kLFDAと組み合わせた場合、Rank-1正解率47.7%を達成し、より高い順位で2位となった。
  • CUHK01データセットでは、kLFDAと組み合わせた場合、Rank-1正解率39.5%を達成し、すべてのベースラインおよび既存手法を上回った。
  • マージナル化技術は、特に小規模データセットにおいて一般化性能を顕著に向上させ、暗黙的なデータ拡張をシミュレートした。
  • フレームワークは、ポーズおよび照明の変化に対して強く、すべてのベンチマークデータセットで一貫した性能向上が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。