Skip to main content
QUICK REVIEW

[論文レビュー] Improving Deep Visual Representation for Person Re-identification by Global and Local Image-language Association

Dapeng Chen, Hongsheng Li|arXiv (Cornell University)|Aug 5, 2018
Multimodal Machine Learning Applications参考文献 38被引用数 8
ひとこと要約

本稿では、人物再識別のための新規手法を提案する。自然言語記述を学習の教師信号として用いることで、グローバルおよびローカルな画像-言語連関を介して深層視覚表現を向上させる。アテンションベースの特徴一致を用いて、アイデンティティレベルのグローバル整合性と領域-語句のローカル対応を同時に最適化することで、テスト時に補助データを用いないMarket-1501、CUHK03、CUHK01の全ベンチマークで最先端の性能を達成する。

ABSTRACT

Person re-identification is an important task that requires learning discriminative visual features for distinguishing different person identities. Diverse auxiliary information has been utilized to improve the visual feature learning. In this paper, we propose to exploit natural language description as additional training supervisions for effective visual features. Compared with other auxiliary information, language can describe a specific person from more compact and semantic visual aspects, thus is complementary to the pixel-level image data. Our method not only learns better global visual feature with the supervision of the overall description but also enforces semantic consistencies between local visual and linguistic features, which is achieved by building global and local image-language associations. The global image-language association is established according to the identity labels, while the local association is based upon the implicit correspondences between image regions and noun phrases. Extensive experiments demonstrate the effectiveness of employing language as training supervisions with the two association schemes. Our method achieves state-of-the-art performance without utilizing any auxiliary information during testing and shows better performance than other joint embedding methods for the image-language association.

研究の動機と目的

  • 自然言語記述を学習の教師信号として組み込むことで、人物再識別のための深層視覚表現を向上させること。
  • 言語からの意味的で高レベルの情報を活用することで、データが少ない状況下でも判別力のある特徴を学習する課題に対処すること。
  • 異なる粒度で視覚的特徴学習をガイドするため、グローバルおよびローカルな画像-言語連関を確立すること。
  • ポーズや属性、カメラIDといった既存の補助信号と比較して、言語ベースの教師信号がより効果的で補完的であることを示すこと。
  • 推論時に補助データに依存せずに最先端の性能を達成すること。

提案手法

  • 本手法は二重の教師信号スキームを採用する:アイデンティティラベルに基づくグローバルな画像-言語連関により、全体的な画像特徴とテキスト特徴を一致させる。
  • ローカルな画像-言語連関はアテンション機構を介して確立され、語句(名詞句)と対応する画像領域を結びつけることで、意味的一致性を強制する。
  • 語句特徴は、注目された視覚的特徴から再構成され、特徴埋め込みの解釈可能性を高めるとともに、学習プロセスを正則化する。
  • モデルはResNet-50バックボーンを用い、再識別精度と画像-テキスト一致の両方を同時に最適化するマルチタスク学習を実装する。
  • グローバルおよびローカルな連関損失を組み合わせ、視覚的および言語的特徴表現の学習を支援する。
  • 弱教師付きの画像-テキストペア(各人物画像が記述文とペアにされたもの)を用いて、エンドツーエンドでフレームワークを訓練する。

実験結果

リサーチクエスチョン

  • RQ1自然言語記述は、人物再識別のための深層視覚表現を向上させる有効な教師信号として機能するか?
  • RQ2グローバルおよびローカルな画像-言語連関は、より判別力があり意味的に整合性のある特徴を学習するためにどのように寄与するか?
  • RQ3提案手法は、既存の画像-テキスト共同埋め込み手法よりも優れているか?
  • RQ4訓練データが限られた状況下でも、言語の教師信号が性能向上に寄与するか?
  • RQ5テスト時に補助データを一切使用しない状況でも、複数のベンチマークデータセットに一般化可能か?

主な発見

  • 提案手法は、マルチクエリプロトコル下でMarket-1501で81.8%のmAPおよび93.3%のトップ1正解率を達成し、最先端の性能を示した。
  • CUHK03(ラベル付きボックス)では、トップ1正解率92.5%、トップ5正解率98.8%を達成し、前回の最先端手法D-personをトップ1正解率1.1%上回った。
  • CUHK01では、ベースラインからトップ1正解率7.8%の向上を達成し、データが少ない状況下でも顕著な有効性を示した。
  • アブレーションスタディにより、グローバルおよびローカルな画像-言語連関が有効かつ補完的であることが確認され、特にローカルスキームが特徴の解釈可能性と一致性向上に顕著な寄与を示した。
  • 他の画像-テキスト対応の共同埋め込み手法と比較して、本手法は提案された連関スキームの優位性を示した。
  • 推論時にポーズ、カメラID、属性などのいかなる補助情報も使用しない状況でも優れた性能を達成しており、言語が自己教師信号としての有効性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。