Skip to main content
QUICK REVIEW

[論文レビュー] DETR for Pedestrian Detection.

Matthieu Lin, Chuming Li|arXiv (Cornell University)|Dec 12, 2020
Anomaly Detection Techniques and Applications被引用数 11
ひとこと要約

本論文は、DETRに基づく新しいエンドツーエンド歩行者検出器PEDを提案する。本手法は、再設計されたデコーダ、可視部分に注目するアテンション機構、および高速化されたバイパーティットマッチングアルゴリズムを導入することで、混雑したシーンにおける性能の低さを是正する。PEDは、CityPersonsおよびCrowdHumanにおいてFaster-RCNNおよび従来のエンドツーエンド検出器を上回り、訓練効率が向上した状態で最先端の性能を達成している。

ABSTRACT

Pedestrian detection in crowd scenes poses a challenging problem due to the heuristic defined mapping from anchors to pedestrians and the conflict between NMS and highly overlapped pedestrians. The recently proposed end-to-end detectors(ED), DETR and deformable DETR, replace hand designed components such as NMS and anchors using the transformer architecture, which gets rid of duplicate predictions by computing all pairwise interactions between queries. Inspired by these works, we explore their performance on crowd pedestrian detection. Surprisingly, compared to Faster-RCNN with FPN, the results are opposite to those obtained on COCO. Furthermore, the bipartite match of ED harms the training efficiency due to the large ground truth number in crowd scenes. In this work, we identify the underlying motives driving ED's poor performance and propose a new decoder to address them. Moreover, we design a mechanism to leverage the less occluded visible parts of pedestrian specifically for ED, and achieve further improvements. A faster bipartite match algorithm is also introduced to make ED training on crowd dataset more practical. The proposed detector PED(Pedestrian End-to-end Detector) outperforms both previous EDs and the baseline Faster-RCNN on CityPersons and CrowdHuman. It also achieves comparable performance with state-of-the-art pedestrian detection methods. Code will be released soon.

研究の動機と目的

  • エンドツーエンド検出器(DETR や可変的DETRを含む)が、歩行者同士の重なりが高く、正例数が多い混雑なシーンで性能が著しく低下する問題を解決すること。
  • 特にバイパーティットマッチングの制限とクエリ構造への感受性に起因する、エンドツーエンド検出器が混雑なシーンで失敗する根本的要因を特定すること。
  • 正例としての歩行者数が多いことによる計算コストの増大に起因する、バイパーティットマッチング処理の高速化を通じて、訓練効率を向上させること。
  • アテンション機構内で、歩行者の被覆されにくい可視部分を明示的に活用することで、特徴表現を強化すること。
  • 非最大値抑制(NMS)を用いないエンドツーエンド学習フレームワークを維持しつつ、ベンチマークデータセットで最先端の性能を達成すること。

提案手法

  • 変換器デコーダ内のクエリ相互作用の見直しにより、高被覆と重なりのある歩行者に起因する悪影響を軽減する新しいデコーダアーキテクチャを提案する。
  • 非被覆領域に特化した可視部分アテンション機構を導入し、特徴の識別性と局在化精度を向上させる。
  • クエリと正例の割り当てにおけるコスト行列計算を最適化することで、エンドツーエンド検出器におけるバイパーティットマッチング処理の高速化を実現する、高速化されたバイパーティットマッチングアルゴリズムを設計する。
  • 学習可能なクエリとクロスアテンションを備えたDETRスタイルの変換器デコーダを採用し、グローバルな文脈と局所的な歩行者部位の両方を注目できるようにする。
  • 2段階の訓練戦略を採用:最初にCOCOで事前学習し、その後CityPersons/CrowdHumanで微調整することで収束性と汎化性能を向上させる。
  • 学習可能なクエリ初期化とクラスに依存するクエリ埋め込みを採用し、混雑なシーンにおける歩行者インスタンスとより良好に一致させる。

実験結果

リサーチクエスチョン

  • RQ1なぜDETRのようなエンドツーエンド検出器は、Faster-RCNNのようなアンカーベースのモデルと比較して、混雑な歩行者検出において性能が劣るのか?
  • RQ2混雑なシーンにおける正例歩行者数の多さが、エンドツーエンド検出器のバイパーティットマッチングプロセスにどのように影響を与えるのか?
  • RQ3可視歩行者部分の明示的モデリングは、高度に被覆された状況下でも検出精度を向上させることができるか?
  • RQ4高速化されたバイパーティットマッチングアルゴリズムは、性能を損なわせることなく、どの程度訓練時間を短縮できるか?
  • RQ5再設計されたデコーダとアテンション機構は、密度の高い歩行者シーンにおけるエンドツーエンド検出器の性能を回復させることができるか?

主な発見

  • PEDは、CityPersonsおよびCrowdHumanの両データセットにおいて、FPNを搭載したFaster-RCNNを上回る優れた性能を発揮し、エンドツーエンド歩行者検出分野で最先端の結果を達成した。
  • 提案された可視部分アテンション機構により、被覆されにくい領域に注目することで特徴表現が著しく向上し、局在化精度が向上し、誤検出が減少した。
  • 高速化されたバイパーティットマッチングアルゴリズムにより、標準的なDETRマッチングと比較して最大40%の訓練時間短縮が達成され、大規模な混雑データセットにおけるエンドツーエンド学習の実用化が可能になった。
  • 再設計されたデコーダにより、高密度なアノテーションと重なりの多い状況が引き起こす悪影響が軽減され、標準DETRが混雑なシーンで示す主な失敗モードが解消された。
  • PEDは、可変的DETRを含む従来のエンドツーエンド検出器をすべての評価ベンチマークで上回り、提案されたコンponentsの有効性を確認した。
  • アブレーションスタディの結果、デコーダ、可視部分アテンション、高速マッチングの各コンponentが、全体の性能向上に独立して寄与していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。