Skip to main content
QUICK REVIEW

[論文レビュー] Attention-based Few-Shot Person Re-identification Using Meta Learning

Alireza Rahimpour, Hairong Qi|arXiv (Cornell University)|Jun 24, 2018
Video Surveillance and Tracking Methods参考文献 14被引用数 6
ひとこと要約

本稿では、極めて少ない例えで新しいアイデンティティに素早く適応できるエンドツーエンドの注意メカニズムを備えたメタラーニングフレームワークARMを提案する。プローブとギャラリー画像のための専用の注意ベースのエンコーダーを用いて、クロスビューおよびインライン・ビュー間の関係をモデル化することで、PRID2011、CUHK01、CUHK03、Market1501で最先端の性能を達成し、低ショット状況下での優れた一般化性能と特徴の判別力学習を示した。

ABSTRACT

In this paper, we investigate the challenging task of person re-identification from a new perspective and propose an end-to-end attention-based architecture for few-shot re-identification through meta-learning. The motivation for this task lies in the fact that humans, can usually identify another person after just seeing that given person a few times (or even once) by attending to their memory. On the other hand, the unique nature of the person re-identification problem, i.e., only few examples exist per identity and new identities always appearing during testing, calls for a few shot learning architecture with the capacity of handling new identities. Hence, we frame the problem within a meta-learning setting, where a neural network based meta-learner is trained to optimize a learner i.e., an attention-based matching function. Another challenge of the person re-identification problem is the small inter-class difference between different identities and large intra-class difference of the same identity. In order to increase the discriminative power of the model, we propose a new attention-based feature encoding scheme that takes into account the critical intra-view and cross-view relationship of images. We refer to the proposed Attention-based Re-identification Metalearning model as ARM. Extensive evaluations demonstrate the advantages of the ARM as compared to the state-of-the-art on the challenging PRID2011, CUHK01, CUHK03 and Market1501 datasets.

研究の動機と目的

  • 各アイデンティティのトレーニング例が非常に少ない状況、特に新しいアイデンティティが継続的に出現するリアルワールド監視システムにおいて、人物再識別を効果的に行うことを目的とする。
  • 大規模なラベル付きデータに依存する既存手法の限界や、ペairwise やトリプレットベースの損失関数による一般化性能の低さを克服することを目的とする。
  • ギャラリー画像間(インライン・ビュー)およびプローブとギャラリー画像間(クロスビュー)の関係を明示的にモデル化することで、特徴の判別力を向上させることを目的とする。
  • メタラーニングを活用して、少数の例から一般化可能な「ラーナー」ネットワークを訓練することで、推論時に未学習のアイデンティティに迅速に適応できることを目的とする。
  • プローブおよびギャラリー特徴エンコーディングに注意メカニズムを統合した、統合的かつエンドツーエンドのアーキテクチャを設計し、マッチング性能を向上させることを目的とする。

提案手法

  • メタラーナーが、プローブ画像とギャラリー画像をマッチングする責任を負う「ラーナー」ネットワークを最適化するメタラーニングフレームワークを採用する。
  • 注意ベースのギャラリー・エンコーダーは、同じアイデンティティの複数のギャラリー画像間のインライン・ビュー関係をモデル化し、文脈的集約によって特徴表現を強化する。
  • 注意ベースのプローブ・エンコーダーは、すべてのギャラリー特徴に注目することでクロスビュー関係をモデル化し、マッチング時にプローブが関連するギャラリー画像に動的に注目できるようにする。
  • 両エンコーダーの注意メカニズムにより、ネットワークは関連する文脈的情報を選択的に伝搬でき、ビューの変化や外観の変化に対しても判別力が向上する。
  • エンドツーエンドの訓練が、少サンプル再識別タスクを直接反映するメタラーニング目的関数に基づいて実施され、ハードネガティブ・マイニングやマージンチューニングの必要がなくなる。
  • 注意メカニズム内のメモリ構造は、メタラーナーがラーナーを効率的に更新する方法を学習するのを支援し、未学習のアイデンティティへのゼロショット一般化を促進する。

実験結果

リサーチクエスチョン

  • RQ1メタラーニングは、アイデンティティごとに非常に少ないラベル付き例えでの人物再識別において、ディープラーニングモデルが新しいアイデンティティに一般化できるか?
  • RQ2注意メカニズムは、インライン・ビュー(ギャラリー)およびクロスビュー(プローブ→ギャラリー)の両関係を効果的にモデル化することで、特徴の判別力をどのように向上させられるか?
  • RQ3エンドツーエンドの注意ベースのメタラーニングフレームワークは、既存のシアンセイ、トリプレットベース、分類ベースの再識別モデルに比べ、低ショット設定で優れた性能を示すか?
  • RQ4提案された注意ベースの特徴エンコーディングは、人物再識別におけるビューの変化、遮蔽、外観の不一致の影響をどの程度軽減するか?
  • RQ5メタラーニングの枠組みにより、ファインチューニングやアーキテクチャの変更なしに、未学習のアイデンティティに一般化できるか?

主な発見

  • ARMは、PRID2011、CUHK01、CUHK03、Market1501ベンチマークで最先端の性能を達成し、少サンプル再識別設定において既存手法を上回った。
  • 注意ベースのギャラリー・エンコーダーは、同じアイデンティティの複数の画像間のインライン・ビュー関係を捉えることで、特徴表現を顕著に向上させた。
  • プローブ・エンコーダーがすべてのギャラリー特徴に注目できる能力により、特に大きな視点や外観の変化がある状況でもクロスビューマッチングの正確性が向上した。
  • メタラーニングフレームワークにより、推論時に新しいアイデンティティに迅速に適応でき、新しいクラスの再トレーニングやファインチューニングの必要がなかった。
  • トリプレットベースやペアワイズマッチング手法に比べ、モデルは優れた一般化能力を示した。これらの手法は、通常、ハードネガティブ例や固定マージンに依存する訓練のため、一般化性能が低い傾向にある。
  • 広範な評価により、提案された注意メカニズムとメタラーニング戦略が共同で判別力のある特徴学習を強化し、低ショットアイデンティティを有する多様なデータセットで一貫した性能向上をもたらしたことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。