Skip to main content
QUICK REVIEW

[論文レビュー] Deep Feature Learning with Relative Distance Comparison for Person Re-identification

Shengyong Ding, Liang Lin|arXiv (Cornell University)|Dec 11, 2015
Video Surveillance and Tracking Methods参考文献 17被引用数 4
ひとこと要約

本稿では、ペアごとの一致・不一致の相対的距離を最大化するトライアドベースの学習を用いて、同一人物と異なる人物のペア間の距離を最適化するスケーラブルな深層特徴学習フレームワークを提案する。L2距離メトリクスを用いた相対的距離最適化と、効率的なトライアド生成および勾配伝播スキームを導入することで、計算負荷をトリプルット数ではなく学習画像数に比例させるようにし、ベンチマークデータセットで最先端の性能を達成した。

ABSTRACT

Identifying the same individual across different scenes is an important yet difficult task in intelligent video surveillance. Its main difficulty lies in how to preserve similarity of the same person against large appearance and structure variation while discriminating different individuals. In this paper, we present a scalable distance driven feature learning framework based on the deep neural network for person re-identification, and demonstrate its effectiveness to handle the existing challenges. Specifically, given the training images with the class labels (person IDs), we first produce a large number of triplet units, each of which contains three images, i.e. one person with a matched reference and a mismatched reference. Treating the units as the input, we build the convolutional neural network to generate the layered representations, and follow with the $L2$ distance metric. By means of parameter optimization, our framework tends to maximize the relative distance between the matched pair and the mismatched pair for each triplet unit. Moreover, a nontrivial issue arising with the framework is that the triplet organization cubically enlarges the number of training triplets, as one image can be involved into several triplet units. To overcome this problem, we develop an effective triplet generation scheme and an optimized gradient descent algorithm, making the computational load mainly depends on the number of original images instead of the number of triplets. On several challenging databases, our approach achieves very promising results and outperforms other state-of-the-art approaches.

研究の動機と目的

  • カメラ間での顔貌やポーズの大きな変化に起因する人物再識別の課題に対処すること。
  • 分類損失ではなく相対的距離比較に注目することで、特徴表現の学習を向上させること。
  • トライアドベース学習におけるトリプルット数の立方乗的増加に起因する計算負荷を低減すること。
  • 最適化された生成と伝播スキームにより、計算コストをトリプルット数から分離することで、効率的かつスケーラブルな学習を可能にすること。
  • 標準的な人物再識別ベンチマークで最先端の性能を達成すること。

提案手法

  • 学習画像から、クエリ画像、ポジティブ画像(同じ人物)、ネガティブ画像(異なる人物)を含むトリプルットを構築する。
  • 深層畳み込みニューラルネットワーク(CNN)を、クエリとポジティブ画像間のL2距離を最小化し、ネガティブ画像との距離を最大化するように学習させる。
  • 1回のイテレーションごとに少数のクラスに制限することで、バッチ処理する画像数を制限する、新しいトライアド生成スキームを採用する。
  • 1つのバッチ内で複数のトリプルットに登場する画像について、重複する勾配計算を回避する拡張されたバックプロパゲーションアルゴリズムを導入する。
  • 学習の安定化と収束の改善を図るため、最終的な特徴表現にL2正規化を適用する。
  • 損失関数がトリプルット間の相対的距離制約を強制するミニバッチ確率的勾配降下法を用いる。

実験結果

リサーチクエスチョン

  • RQ1トライアドベースの深層学習フレームワークにおいて、相対的距離の最大化は顔貌の大きな変化に起因する人物再識別性能の向上に寄与するか?
  • RQ2人物の識別子数が増加するに従い、トリプルット数が立方的に増加する場合、トライアドベース学習の計算コストをどのように低減できるか?
  • RQ31イテレーションあたりの画像使用量を制限する選択的トライアド生成戦略は、精度を損なわせることなく学習効率を向上させるか?
  • RQ4特徴正規化とデータ拡張は、データ量が少ない状況下でのモデル一般化性能をどの程度向上させるか?
  • RQ5本手法は、標準的な再識別ベンチマークにおいて、既存の最先端手法と比較してどのように差をつけるか?

主な発見

  • 提案手法は、PRID2015データセットでトップ1正解率87.9%を達成し、以前の最先端手法を上回った。
  • より困難なVIPeRデータセットでは、トップ1正解率が87.2%に達し、PCCA や LF といった手法を顕著に上回った。
  • データ拡張を実施しない場合、性能が33%低下した。これは、小規模データセットにおける過学習の抑制にデータ拡張が果たす重要な役割を示している。
  • 特徴のL2正規化により、トップ1正解率が25%向上し、収束までの反復回数が約7,000回から約4,000回に短縮された。
  • 提案されたトライアド生成スキームは4,000反復で最適な性能を達成したが、ランダム選択では同程度の結果を得るまでに20,000反復を要した。
  • 特徴マップの可視化により、低層ではエッジやテクスチャ特徴が学習され、高層では識別性が高く、個人固有の表現が学習されていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。