Skip to main content
QUICK REVIEW

[論文レビュー] Resource Aware Person Re-identification across Multiple Resolutions

Yan Wang, Lequn Wang|arXiv (Cornell University)|May 22, 2018
Video Surveillance and Tracking Methods被引用数 16
ひとこと要約

本稿では、深層畳み込みネットワークの異なる層からのマルチレベル特徴をディープスーパービジョンを用いて統合する、リソースに配慮した人物再識別モデルを提案する。低レベル(高解像度)および高レベル(意味的)な埋め込みを組み合わせることで、5つのベンチマークで最先端の精度を達成し、リソース制約下で精度と計算コストの動的トレードオフを実現する。

ABSTRACT

Not all people are equally easy to identify: color statistics might be enough for some cases while others might require careful reasoning about high- and low-level details. However, prevailing person re-identification(re-ID) methods use one-size-fits-all high-level embeddings from deep convolutional networks for all cases. This might limit their accuracy on difficult examples or makes them needlessly expensive for the easy ones. To remedy this, we present a new person re-ID model that combines effective embeddings built on multiple convolutional network layers, trained with deep-supervision. On traditional re-ID benchmarks, our method improves substantially over the previous state-of-the-art results on all five datasets that we evaluate on. We then propose two new formulations of the person re-ID problem under resource-constraints, and show how our model can be used to effectively trade off accuracy and computation in the presence of resource constraints. Code and pre-trained models are available at https://github.com/mileyan/DARENet.

研究の動機と目的

  • すべての画像に対して一様な高レベル埋め込みを用いる従来の人物再識別モデルの制限を解消する。
  • 初期ネットワーク層からの細粒度の空間的詳細を活用することで、識別が難しい個体の精度を向上させる。
  • 信頼度または距離指標に基づく早期終了を可能にすることで、識別が容易な個体に対する不要な計算を削減する。
  • 計算コストと対応する精度レベルのスケールを提供することで、リソース制約下での効率的な推論を可能にする。
  • 実世界の展開を想定し、高精度および低コストの両方の推論モードをサポートする統合モデルを開発する。

提案手法

  • ResNet-50バックボーンの複数段階からの特徴埋め込みを統合し、低レベル(初期)および高レベル(後期)表現を組み合わせる。
  • 各中間埋め込みヘッドを三重損失で訓練することで、段階ごとに再識別タスクに最適化されたディープスーパービジョンを適用する。
  • 信頼度マージン(2番目に近いネガティブサンプルまでの距離)または最短ギャラリー距離に基づく早期終了戦略を用いて計算量を削減する。
  • クエリが事前に定義されたしきい値に従って、任意の段階で終了可能なマルチステージ推論パイプラインを採用する。
  • すべての段階で共同最適化を行うエンドツーエンドの訓練により、各レベルでの一貫性とパフォーマンスを保証する。
  • 計算コストをFLOPs(乗加算演算数)で追跡する、リアルタイムでリソース制約のある推論をシミュレートする予算付きストリーミング設定を導入する。

実験結果

リサーチクエスチョン

  • RQ1単一の深層ネットワークから得られるマルチレベル特徴の統合は、多様な識別困難度の個体に対して人物再識別精度を向上させることができるか?
  • RQ21つのモデルが推論時に精度と計算コストの動的トレードオフをサポートできるか?
  • RQ3高い精度を維持しつつ推論コストを削減する効果的な早期終了基準は何か?
  • RQ4提案手法は、標準的およびリソース制約下の再識別設定の両方で最先端のモデルを上回るか?
  • RQ5低レベル特徴と高レベル特徴は識別にどのように異なる貢献をし、それらの統合がどのように耐性を向上させるか?

主な発見

  • 提案モデルは、5つの標準的人物再識別ベンチマークすべてで最先端の性能を達成し、CMC Rank-1精度で先行手法を上回った。
  • 予算付きストリーミング設定において、マージンに基づく早期終了戦略は、ランダムまたは距離ベースの手法よりも低い計算コストで高い精度を達成した。
  • 統合された特徴表現は、個々の段階よりも一貫して識別精度を向上させ、特に低レベルと高レベル特徴が合意しないハードな例において顕著だった。
  • 可視化結果から、初期段階の特徴は明確な衣類など容易なケースに有効であるのに対し、後期段階の特徴はポーズや視点の変化に対応していることが確認された。
  • モデルは、Market-1501データセットにおいて、低予算で約60%のCMC Rank-1精度から高予算で85%を超えるまで、精度と計算量の滑らかなトレードオフを実現した。
  • 本手法は、単一の固定モデルではなく、複数のパフォーマンスポイントを提供する動的でリソースに配慮した推論を可能にする最初の手法である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。