Skip to main content
QUICK REVIEW

[論文レビュー] HorNet: A Hierarchical Offshoot Recurrent Network for Improving Person Re-ID via Image Captioning

Shiyang Yan, Jun Xu|arXiv (Cornell University)|Aug 14, 2019
Video Surveillance and Tracking Methods参考文献 19被引用数 4
ひとこと要約

本稿では、画像と自動生成キャプションから視覚的・言語的表現を共同で学習し、人物再識別(re-ID)を向上させる階層的分岐型再帰的ネットワーク、HorNetを提案する。SPGANによるドメイン転送とキャプション生成器を用いて高品質な記述を生成し、2層LSTMにおける離散的バイナリゲートを活用して関連する言語特徴をフィルタリングすることで、CUHK03、Market-1501、Duke-MTMCで最先端の性能を達成した。リランク後、Duke-MTMCでは79.2%のmAPと97.1%のtop-1 CMC精度を達成した。

ABSTRACT

Person re-identification (re-ID) aims to recognize a person-of-interest across different cameras with notable appearance variance. Existing research works focused on the capability and robustness of visual representation. In this paper, instead, we propose a novel hierarchical offshoot recurrent network (HorNet) for improving person re-ID via image captioning. Image captions are semantically richer and more consistent than visual attributes, which could significantly alleviate the variance. We use the similarity preserving generative adversarial network (SPGAN) and an image captioner to fulfill domain transfer and language descriptions generation. Then the proposed HorNet can learn the visual and language representation from both the images and captions jointly, and thus enhance the performance of person re-ID. Extensive experiments are conducted on several benchmark datasets with or without image captions, i.e., CUHK03, Market-1501, and Duke-MTMC, demonstrating the superiority of the proposed method. Our method can generate and extract meaningful image captions while achieving state-of-the-art performance.

研究の動機と目的

  • ポーズ、視点、照明の変化に起因する外観のばらつきを解消すること。
  • 現実世界の人物再識別データセットにおけるアノテート済み言語記述の不足を克服すること。
  • 未学習の人物画像に対して高品質で判別力のある画像キャプションを生成する手法を開発すること。
  • 新しい階層的再帰的アーキテクチャを用いて視覚的・言語的表現を共同で学習すること。
  • アノテート済みおよび自動生成キャプションの両方を用いて、最先端の再識別性能を達成すること。

提案手法

  • 類似度保持型生成対抗ネットワーク(SPGAN)を用いて、現実世界の画像を統一ドメインに変換し、キャプション品質を向上させる。
  • 画像キャプション生成器が、特にアノテーションのないデータセット向けに、人物画像の意味的記述を生成する。
  • HorNetは2ブランチアーキテクチャを採用:視覚的特徴抽出のためのCNN(ResNet-50)と、Gumbel-Softmaxゲートを備えた2層LSTMによる言語表現。
  • LSTM内の離散的バイナリゲートがキャプションからの関連語を動的に選択し、視覚的特徴と整合性を保証する。
  • 視覚的および言語的表現を同時に最適化することで、re-IDのための特徴の判別能を向上させる。
  • 特徴抽出後にリランク処理を適用し、mAPおよびCMCスコアをさらに向上させる。

実験結果

リサーチクエスチョン

  • RQ1自動生成された画像キャプションは、人物再識別における外観のばらつきを顕著に低減できるか?
  • RQ2階層的分岐型再帰的ネットワークは、re-IDにおける視覚的・言語的表現の統合にどの程度有効か?
  • RQ3SPGANによるドメイン適応は、後続のre-IDタスクにおける生成キャプション品質を向上させるか?
  • RQ4補助的な言語情報や属性情報を利用した既存手法よりも、HorNetは優れた性能を発揮できるか?
  • RQ5キャプション品質が、ドメイン間転送時のre-ID性能に与える影響は何か?

主な発見

  • ラベル付きキャプションを用いたCUHK03では、HorNetが97.1%のtop-1 CMC精度を達成し、ILA手法比で4.6%の向上を示した。
  • Market-1501では85.8%のmAPを達成し、データセット間での強い汎化性能を示した。
  • キャプションのないDuke-MTMCでは、ドメイン転送とキャプション生成後、mAPが60.4%に達し、ベースラインの視覚的特徴を上回った。
  • リランク処理を施した後、Duke-MTMCのmAPは79.2%に上昇し、共同表現学習の有効性を示した。
  • BERTにHorNetを置き換えると性能が低下し、提案されたゲート制御アーキテクチャの優位性が裏付けられた。
  • アブレーションスタディにより、キャプション生成モジュールおよび階層的分岐メカニズムが最適性能を達成するために不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。