Skip to main content
QUICK REVIEW

[論文レビュー] Combined Depth Space based Architecture Search For Person Re-identification

Hanjun Li, Gaojie Wu|arXiv (Cornell University)|Apr 9, 2021
Video Surveillance and Tracking Methods被引用数 16
ひとこと要約

本稿では、人物再識別(ReID)を目的とした、新しい微分可能アーキテクチャ探索フレームワーク「コンビネッドディープネススペース(CDS)」を提案する。これにより、軽量で効率的なネットワーク「CDNet」が導入される。マルチブランチブロックによる統合パターン学習とTop-kサンプル探索戦略を活用することで、CDNetは軽量モデルの中で最先端の性能を達成した—Market1501では1.8Mパラメータと955.1M FLOPsで95.1%のランキング1精度を記録し、より大きなバックボーンや既存の軽量モデルを上回る速度と精度を実現した。

ABSTRACT

Most works on person re-identification (ReID) take advantage of large backbone networks such as ResNet, which are designed for image classification instead of ReID, for feature extraction. However, these backbones may not be computationally efficient or the most suitable architectures for ReID. In this work, we aim to design a lightweight and suitable network for ReID. We propose a novel search space called Combined Depth Space (CDS), based on which we search for an efficient network architecture, which we call CDNet, via a differentiable architecture search algorithm. Through the use of the combined basic building blocks in CDS, CDNet tends to focus on combined pattern information that is typically found in images of pedestrians. We then propose a low-cost search strategy named the Top-k Sample Search strategy to make full use of the search space and avoid trapping in local optimal result. Furthermore, an effective Fine-grained Balance Neck (FBLNeck), which is removable at the inference time, is presented to balance the effects of triplet loss and softmax loss during the training process. Extensive experiments show that our CDNet (~1.8M parameters) has comparable performance with state-of-the-art lightweight networks.

研究の動機と目的

  • ImageNetで事前学習されたバックボーン(例:ResNet)の使用に起因する制限を克服し、軽量で計算効率が良く、ReIDに最適化されたニューラルアーキテクチャを設計すること。
  • 既存のNASにおける探索空間の非効率さと最適でない設計を是正し、歩行者画像に共通する統合パターン特徴を明示的にモデル化できない点を解決すること。
  • 上位k個のサンプルを選択的に計算することで、局所最適解への早期収束を回避し、探索コストを低減するTop-kサンプル探索戦略を導入すること。
  • ストライプベースの局所特徴統合メカニズムにより、三重項損失とソフトマックス損失の最適化目的の対立を調整する、取り外し可能な高精度バランスネック(FBLNeck)を提案することで、学習の安定性と性能を向上させること。
  • 解像度・幅のスケーリングを用いて、CDNetの転移性と耐障害性を検証し、ImageNetやエッジデプロイメント環境でも有効であることを示すこと。

提案手法

  • 歩行者画像からマルチスケールの統合パターン特徴を明示的に学習できるように、各セルに異なるカーネルサイズの2本のブランチを持つ「コンビネッドブロック(CBlock)」を用いた、新しい探索空間「コンビネッドディープネススペース(CDS)」を提案する。
  • 前方伝搬中に上位k個の重みの高い演算のみを計算するTop-kサンプル探索戦略を導入し、探索コストを低減するとともに、局所最適解への収束を回避する。
  • 各レイヤーごとに独立してセルを探索できるレイヤーごとのアーキテクチャ探索戦略を設計し、従来の方法とは異なり、レイヤー間で同一のセルを再利用せず、深さに応じたパターン学習を可能にする。
  • 三重項損失とソフトマックス損失の最適化目的の対立を、ストライプベースの局所特徴統合メカニズムで調整する、取り外し可能なネックモジュール「高精度バランスネック(FBLNeck)」を設計する。
  • トレーニング中に三重項損失とソフトマックス損失の両方を同時に最適化するように変更された探索目的関数を用いて、微分可能アーキテクチャ探索(DARTS)を実装する。
  • エッジデバイスへのデプロイメントを想定し、幅乗数βと解像度乗数γを用いてCDNetをスケーリングし、低リソース環境への効率的適応を可能にする。

実験結果

リサーチクエスチョン

  • RQ1歩行者画像に特有の統合パターン特徴を明示的にモデル化できるように設計された探索空間は、標準的なNAS探索空間と比較してReID性能を向上させることができるか?
  • RQ2Top-kサンプル探索戦略は、単一の高確率パスに依存するのを避けることで、探索コストを低減し、探索品質を向上させることができるか?
  • RQ3取り外し可能なFBLNeckは、三重項損失とソフトマックス損失の最適化を効果的にバランスさせ、ReIDにおける一般化性能を向上させることができるか?
  • RQ4探索されたCDNetの性能は、既存の軽量ReIDモデルと比較して、精度、パラメータ数、FLOPsの観点で優れているか?
  • RQ5CDNetは、ReIDに特化して学習されたにもかかわらず、ImageNet分類など他のタスクへどの程度一般化可能であるか?

主な発見

  • CDNetは、1.8Mパラメータと955.1M FLOPsでMarket1501で95.1%のランク1精度と86.0%のmAPを達成し、より大きなモデル(BagofTrick:25.1Mパラメータ)や既存の軽量モデル(OSNet:2.2Mパラメータ)を、精度と推論速度の両面で上回った。
  • Top-kサンプル探索戦略により、探索コストが低減されるとともに、局所最適解への収束が回避され、CDS探索空間の有効な探索が可能になった。
  • FBLNeckをOSNetに組み込むことで性能が顕著に向上し、mAPとランク1精度が向上した。さらに、推論時には取り外すことでモデルサイズを削減できる。
  • CDNetはImageNetへも良好に一般化され、MobileNetV2より少ないパラメータで75.1%のトップ1精度を達成し、DARTSとGDASをそれぞれ1.8%、1.1%上回った。
  • 幅乗数βと解像度乗数γによるスケーリングにより、強力な性能が維持された—β=0.25、γ=0.5では91.7%のランク1精度と79.7%のmAPを達成し、β=0.25、γ=1.0でも同様に91.7%/79.7%の性能を示したが、パラメータ数はわずか0.1M、FLOPsは77.9Mにまで削減された。
  • CDNetはエッジデプロイメントへの強い潜在能力を示しており、RTX 2080での推論時間は142.4msと、同程度または高い精度を持つモデルと比較して顕著に高速であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。