Skip to main content
QUICK REVIEW

[論文レビュー] Center and Scale Prediction: Anchor-free Approach for Pedestrian and Face Detection

Wei Liu, Irtiza Hasan|arXiv (Cornell University)|Apr 5, 2019
Advanced Neural Network Applications被引用数 4
ひとこと要約

本論文は、完全畳み込みネットワークを用いて、歩行者および顔検出を、中心点とスケールの同時回帰タスクとして定式化するアンカーフリー物体検出手法、Center and Scale Prediction (CSP) を提案する。'どこに'と'どれくらいの大きさか'というサブ問題を別々の畳み込みヘッドに分離することで、アンカーボックスの必要性を排除し、トレーニングとハイパーパramータチューニングの簡素化を実現するとともに、CityPersonsおよびCaltechで最先端の性能を達成し、WiderFaceおよびクロスデータセット評価においても優れた汎化性能を示す。

ABSTRACT

Object detection generally requires sliding-window classifiers in tradition or anchor box based predictions in modern deep learning approaches. However, either of these approaches requires tedious configurations in boxes. In this paper, we provide a new perspective where detecting objects is motivated as a high-level semantic feature detection task. Like edges, corners, blobs and other feature detectors, the proposed detector scans for feature points all over the image, for which the convolution is naturally suited. However, unlike these traditional low-level features, the proposed detector goes for a higher-level abstraction, that is, we are looking for central points where there are objects, and modern deep models are already capable of such a high-level semantic abstraction. Besides, like blob detection, we also predict the scales of the central points, which is also a straightforward convolution. Therefore, in this paper, pedestrian and face detection is simplified as a straightforward center and scale prediction task through convolutions. This way, the proposed method enjoys a box-free setting. Though structurally simple, it presents competitive accuracy on several challenging benchmarks, including pedestrian detection and face detection. Furthermore, a cross-dataset evaluation is performed, demonstrating a superior generalization ability of the proposed method. Code and models can be accessed at (https://github.com/liuwei16/CSP and https://github.com/hasanirtiza/Pedestron).

研究の動機と目的

  • 歩行者および顔検出におけるアンカーベースの物体検出の複雑さとハイパーパramータ感受性を解消すること。
  • 物体検出における'どこに'と'どれくらいの大きさか'というサブ問題が、深層畳み込みネットワークを用いて独立したタスクに分離可能かどうかを検討すること。
  • データセット固有のアンカーカンfigレーションに依存せずに、複数のデータセットにわたって良好に汎化する手法を開発すること。
  • 高レベルのセマンティック特徴、特に物体の中心点とスケール予測が、深層畳み込みネットワークによって効果的に学習可能かどうかを示すこと。

提案手法

  • 本手法は、物体検出を2ヘッドの畳み込み予測タスクとして定式化する:物体の中心点を予測し、それに応じたスケールを出力する。
  • 中心点予測は、各物体の中心点を学習可能な畳み込み層を用いて特定するヒートマップ回帰ヘッドによって実行される。
  • スケール予測は、各中心点における物体のスケール(例:サイズや半径)を出力する別々の回帰ヘッドによって達成される。
  • モデルは、バウンディングボックスまたは中央線アノテーションから導出された真値の中心点およびスケールアノテーションを用いてトレーニングされ、アンカーボックスの必要性がなくなる。
  • このアプローチは本質的にアンカーフリーであり、アンカーサイズ、アスペクト比、オーバーラップしきい値の設定が不要となる。
  • 後処理は最小限に抑えられ、他のアンカーフリー手法で用いられる複雑なキーポイントペアリング戦略を回避する。

実験結果

リサーチクエスチョン

  • RQ1深層畳み込みネットワークを用いて、物体検出における'どこに'と'どれくらいの大きさか'というサブ問題を、独立した学習可能なタスクに効果的に分離できるか。
  • RQ2中心点とスケール予測に基づくアンカーフリー検出手法が、精度と汎化性能の面でアンカーベース手法を上回るか。
  • RQ3提案されたCSP検出器は、トレーニングデータとは異なるドメインでテストされた場合、クロスデータセット評価においてどのように性能を示すか。
  • RQ4歩行者や顔といった多様なオブジェクトカテゴリに、再設定なしに汎化可能か。
  • RQ5トレーニング中に中心アノテーションがノイズや曖昧さを含んでも、モデルの性能はどの程度頑健か。

主な発見

  • CityPersonsベンチマークでは、CSP検出器はTLLなどの以前のアンカーフリー手法を上回り、エイジリのセットでAP 0.903を達成した。
  • Caltechでは、曇った中心アノテーションの課題にもかかわらず、エイジリのセットでAP 0.903を達成し、強力な性能を示した。
  • クロスデータセット顔検出では、WiderFaceでトレーニングしたCSPは、WiderFaceで89.9%のAPを達成し、同じトレーニング体制下でUCCSおよびDarkFaceのDSFDモデルを上回った。
  • モデルは優れた汎化性能を示した:WiderFace → UCCSの評価では、CSPは28.0%のMR⁻²を達成し、DSFDの25.9%を上回り、ドメインシフトに対するより高いロバストネスを示した。
  • トレーニング中に中心アノテーションが最大8ピクセルまでずらされた場合、モデルの性能はMR⁻²で3.97%低下し、アノテーション品質への感受性を確認した。
  • アブレーションスタディの結果、ヒートマップヘッドとスケールヘッドを併用したCSP H+Wは、ヒートマップヘッドのみのCSP H(0.903 AP)よりも優れた性能を示し、エイジリのセットで0.961のAPを達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。