Skip to main content
QUICK REVIEW

[論文レビュー] Deep Feature Learning via Structured Graph Laplacian Embedding for Person Re-Identification

De Cheng, Yihong Gong|arXiv (Cornell University)|Jul 25, 2017
Video Surveillance and Tracking Methods参考文献 37被引用数 6
ひとこと要約

本稿では、対照的損失および三重損失の関係を完全グラフに基づくラプラシアンフレームワークに統合することで、より包括的な構造的グラフ・ラプラシアン埋め込み手法を提案する。この手法により、ソフトマックス損失と連合最適化が可能となり、人物再識別性能が向上する。特徴の内部個人的凝集性と外部個人的分散性を強化することで、ResNet50、DGDNet、AlexNetを用いた複数のベンチマークで最先端の性能を達成する。

ABSTRACT

Learning the distance metric between pairs of examples is of great importance for visual recognition, especially for person re-identification (Re-Id). Recently, the contrastive and triplet loss are proposed to enhance the discriminative power of the deeply learned features, and have achieved remarkable success. As can be seen, either the contrastive or triplet loss is just one special case of the Euclidean distance relationships among these training samples. Therefore, we propose a structured graph Laplacian embedding algorithm, which can formulate all these structured distance relationships into the graph Laplacian form. The proposed method can take full advantages of the structured distance relationships among these training samples, with the constructed complete graph. Besides, this formulation makes our method easy-to-implement and super-effective. When embedding the proposed algorithm with the softmax loss for the CNN training, our method can obtain much more robust and discriminative deep features with inter-personal dispersion and intra-personal compactness, which is essential to person Re-Id. We illustrate the effectiveness of our proposed method on top of three popular networks, namely AlexNet, DGDNet and ResNet50, on recent four widely used Re-Id benchmark datasets. Our proposed method achieves state-of-the-art performances.

研究の動機と目的

  • 人物再識別の分野における顔貌やポーズの大きな変動に起因する課題に、深層特徴の判別性向上によって対処する。
  • 従来の対照的損失および三重損失の限界を克服し、統一されたグラフ・ラプラシアンフレームワーク内で、すべてのペアワイズおよび三重距離関係をモデル化する。
  • ソフトマックス損失と連合最適化することで特徴学習を向上させ、外部個人的分散性と内部個人的凝集性の両方を達成する。
  • シアン・ネットワークや三重ネットワークとは異なり、複雑なデータ再結合や追加メモリを必要としない、効率的な学習を可能にする。
  • 複数の深層ネットワークアーキテクチャおよびベンチマークデータセットにおいて、本手法の有効性を実証する。

提案手法

  • 訓練バッチ内の各特徴ベクトルをノードとするNノードの完全グラフを構築する。
  • 対照的損失または三重損失関数から事前に定義された距離関係に基づいて、グラフのエッジ重みを定義する。
  • 構造的グラフ・ラプラシアン埋め込みを、バッチ内のグローバルクラスタ構造および距離構造を捉える正則化項として定式化する。
  • 標準的なソフトマックス交差エントロピー損失と、単一のネットワークブランチ内でグラフ・ラプラシアン損失を統合し、連合最適化を実現する。
  • データ拡張や追加メモリを必要とせず、グラフ・ラプラシアンを用いて内部個人的凝集性と外部個人的分離性を強制する。
  • 確率的勾配降下法を用いて、ソフトマックス損失および構造的グラフ・ラプラシアン損失の両方の監視信号による、エンド・ツー・エンドのCNN学習を実行する。

実験結果

リサーチクエスチョン

  • RQ1孤立した対照的損失や三重損失と比較して、統一されたグラフ・ラプラシアン定式化は、訓練サンプル間の構造的距離関係をより効果的に捉えられるか?
  • RQ2グラフ・ラプラシアン損失とソフトマックス損失の連合最適化により、人物再識別の特徴判別性が向上するか?
  • RQ3複数のベンチマークにおいて、本手法は最先端手法と比較して、ランク-1正答率およびmAPで優れた性能を示すか?
  • RQ4ResNet50、DGDNet、AlexNetなどの異なるCNNアーキテクチャに適用した場合、本手法の影響は何か?
  • RQ5複雑なデータ再編成やメモリオーバーヘッドなしに、標準的なCNN学習にグラフ・ラプラシアン定式化を容易に統合できるか?

主な発見

  • 本手法は、Market-1501、DukeMTMC、CUHK03、CUHK02の各データセットで最先端の性能を達成し、ResNet50を用いたMarket-1501では73.2%のランク-1正答率および97.2%のランク-10正答率を達成した。
  • DGDNetモデルでは、Market-1501で84.7%のランク-1、97.4%のランク-5、98.9%のランク-10正答率を達成し、ベースラインのソフトマックス損失よりもそれぞれ2.3%、1.5%、0.9%の向上を示した。
  • グラフ・ラプラシアン損失とソフトマックス損失の連合学習は、3つのネットワークアーキテクチャすべてにおいて、単独で使用する場合よりも一貫して性能向上をもたらした。
  • t-SNE可視化では、本手法がベースライン手法と比較して、はるかに優れた内部個人的凝集性と外部個人的分離性を実現していることが示された。
  • 特にパrameter数が多い大規模モデル(AlexNetやResNet50)において、グラフ・ラプラシアン正則化を追加することで過学習が軽減された。
  • バッチグローバル三重損失(BGTL)はバッチグローバル対照的損失(BGCL)を上回り、両者の組み合わせ(BGCTL)によりDGDNetで2%の向上が得られた。これは、構造的距離モデリングの有効性を裏付けている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。