Skip to main content
QUICK REVIEW

[論文レビュー] Deep Reinforcement Learning Attention Selection for Person Re-Identification

Lan Xu, Hanxiao Wang|arXiv (Cornell University)|Jul 10, 2017
Video Surveillance and Tracking Methods参考文献 31被引用数 10
ひとこと要約

本稿では、自動検出された人物バウンディングボックス内から、識別に寄与する注目領域を自動的に選択する深層強化学習フレームワーク、IDEALを提案する。Qネットワークを用いてペairワイズre-ID制約に基づき注目領域選択を最適化することで、IDEALは手動で切り抜かれたボックスと同等のre-ID性能を達成し、自動検出設定下で見られる8.2%のランク-1低下をほぼ手動レベルにまで低減する。

ABSTRACT

Existing person re-identification (re-id) methods assume the provision of accurately cropped person bounding boxes with minimum background noise, mostly by manually cropping. This is significantly breached in practice when person bounding boxes must be detected automatically given a very large number of images and/or videos processed. Compared to carefully cropped manually, auto-detected bounding boxes are far less accurate with random amount of background clutter which can degrade notably person re-id matching accuracy. In this work, we develop a joint learning deep model that optimises person re-id attention selection within any auto-detected person bounding boxes by reinforcement learning of background clutter minimisation subject to re-id label pairwise constraints. Specifically, we formulate a novel unified re-id architecture called Identity DiscriminativE Attention reinforcement Learning (IDEAL) to accurately select re-id attention in auto-detected bounding boxes for optimising re-id performance. Our model can improve re-id accuracy comparable to that from exhaustive human manual cropping of bounding boxes with additional advantages from identity discriminative attention selection that specially benefits re-id tasks beyond human knowledge. Extensive comparative evaluations demonstrate the re-id advantages of the proposed IDEAL model over a wide range of state-of-the-art re-id methods on two auto-detected re-id benchmarks CUHK03 and Market-1501.

研究の動機と目的

  • 自動検出されたバウンディングボックスにおける背景の雑音やアライメントのずれによって引き起こされるre-ID性能の低下を是正すること。
  • 手動で切り抜かれたクリーンなバウンディングボックスを仮定している既存のre-ID手法の限界を克服し、大規模な展開に不適切である点を解消すること。
  • 手動によるバウンディングボックスのアノテーションを一切不要としながら、re-ID精度を向上させるエンドツーエンドで自動化された注目領域選択メカニズムを開発すること。
  • 強化学習と深層メトリック学習を統合し、統一されたフレームワーク内で注目領域選択と識別能の両方を同時に最適化すること。
  • 現実的な検出条件下で、自動的注目領域選択が人間レベルの性能に達するか、それを上回ることを実証すること。

提案手法

  • 人物のアイデンティティ埋め込みを処理する深層メトリック学習ネットワークと、注目領域選択を担当する深層Qネットワークを統合した統一アーキテクチャ、IDEALを構築する。
  • ペアワイズre-ID制約に基づく報酬関数を定義する:同一アイデンティティのペア(ポジティブペア)は高い注目類似度を持つべきであり、異なるアイデンティティのペア(ネガティブペア)は低い類似度を持つべきである。
  • 注目領域選択のためのマルチスケールアクション空間を採用し、アクションはバウンディングボックス面積の5%、10%、20%に注目する操作として定義する。
  • 背景の雑音を最小限に抑えつつアイデンティティの識別能を最大化するように、エージェントが注目領域を選択するように、深層Qラーニングにより注目ポリシーを訓練する。
  • 同じ視点の画像同士を比較する相対的比較報酬関数を採用し、一貫した背景パターンを検出することで、誤検出に対する耐性を高める。
  • 訓練されたIDEALモデルは、任意の事前学習済み人物検出器に対して独立して適用可能であり、既存の検出パイプラインにプラグアンドプレイで統合可能である。

実験結果

リサーチクエスチョン

  • RQ1強化学習を用いて、自動検出された人物バウンディングボックス内から識別に寄与する注目領域を効果的に選択することで、re-ID精度を向上させることができるか?
  • RQ2高背景雑音を伴う自動検出ボックスに適用した場合、提案されたIDEALモデルは、最先端の注目ベースre-ID手法と比較してどの程度優れているか?
  • RQ3IDEALによる自動注目領域選択は、re-IDタスクにおいて、手動で切り抜かれたボックスの性能にどの程度近づくか、あるいはそれを上回るか?
  • RQ4注目アクション空間の設計(例:5%、10%、20% 対 10%、20%、30%)がre-ID性能に与える影響は何か?
  • RQ5報酬関数の選択(例:絶対値比較対 相対比較)が、注目学習の耐性および精度に与える影響は何か?

主な発見

  • 自動検出ボックスを用いたCUHK03では、IDEALが71.0%のランク-1精度を達成し、手動で切り抜かれたボックスの71.9%に非常に近い性能を示した。
  • Market-1501では、mAPが91.3%、R20が95.9%を達成し、自動検出入力でも優れた汎化性能を示した。
  • 相対的比較報酬関数は、絶対値比較や順位ベースの関数を上回り、同じ視点のネガティブペア比較を組み込むことで、背景雑音の検出能力が向上した。
  • 最も細分化されたアクション空間({5%、10%、20%})が最良の性能を示し、小さな正確な注目領域がアイデンティティ識別に不可欠であることを示した。
  • ランダムおよび中央部に注目するベースラインは、注目なしの状態よりも性能が悪く、最適な注目領域選択が自明ではなく、知的な学習が必要であることを証明した。
  • IDEALは、自動検出と手動切り出しの間で見られる8.2%のランク-1性能低下をほぼゼロにまで低減し、高価な手動切り出しの必要性を効果的に排除した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。