Skip to main content
QUICK REVIEW

[論文レビュー] Is Faster R-CNN Doing Well for Pedestrian Detection?

Zhang Li-liang, Liang Lin|arXiv (Cornell University)|Jul 24, 2016
Advanced Neural Network Applications参考文献 28被引用数 7
ひとこと要約

本論文は、高解像度特徴量上で領域提案ネットワーク(RPN)に続く段階的ブーストドフォレスト(BF)を用いた、シンプルでありながら効果的な歩行者検出ベースラインを提案する。この手法は、Faster R-CNNの小物対処およびハードネガティブ例のマイニングにおける限界を克服し、Caltech、INRIA、ETH、KITTIベンチマークで最先端の精度を達成する。推論時間は0.5秒で、Caltechにおける0.7 IoUでの局所化精度は相対的に40%向上した。

ABSTRACT

Detecting pedestrian has been arguably addressed as a special topic beyond general object detection. Although recent deep learning object detectors such as Fast/Faster R-CNN [1, 2] have shown excellent performance for general object detection, they have limited success for detecting pedestrian, and previous leading pedestrian detectors were in general hybrid methods combining hand-crafted and deep convolutional features. In this paper, we investigate issues involving Faster R-CNN [2] for pedestrian detection. We discover that the Region Proposal Network (RPN) in Faster R-CNN indeed performs well as a stand-alone pedestrian detector, but surprisingly, the downstream classifier degrades the results. We argue that two reasons account for the unsatisfactory accuracy: (i) insufficient resolution of feature maps for handling small instances, and (ii) lack of any bootstrapping strategy for mining hard negative examples. Driven by these observations, we propose a very simple but effective baseline for pedestrian detection, using an RPN followed by boosted forests on shared, high-resolution convolutional feature maps. We comprehensively evaluate this method on several benchmarks (Caltech, INRIA, ETH, and KITTI), presenting competitive accuracy and good speed. Code will be made publicly available.

研究の動機と目的

  • Faster R-CNNが一般物体検出において優れた性能を示すにもかかわらず、歩行者検出においてはなぜ性能を発揮できないのかを調査すること。
  • Faster R-CNNが歩行者検出に適用された際の性能低下の根本的要因、特に小物対処およびハードネガティブ例マイニングにおける限界を特定すること。
  • ハイブリッドな手作業特徴量を高解像度特徴量と効果的なブートストラップ法に置き換える、シンプルでエンドツーエンドのディープラーニングベースのベースラインを構築すること。
  • 高解像度特徴量とハードネガティブ例マイニングが、歩行者検出において手作業特徴量よりも重要であることを実証すること。

提案手法

  • Faster R-CNNの領域提案ネットワーク(RPN)を独立した検出器として使用し、候補領域を生成する。
  • 浅い、高解像度の畳み込み層から特徴量をプーリングすることで、小規模な歩行者インスタンスの表現を向上させる。
  • 「à trous」(拡張)畳み込み技術を用いて、パrameter数を増加させずに特徴マップの解像度を向上させる。
  • 分類に段階的ブーストドフォレスト(BF)を適用し、RPNから得られる共通の高解像度特徴量を活用することで、計算量を削減し、一般化性能を向上させる。
  • BFが内蔵するブートストラップ法およびサンプル再重み付けを用いて、ハードネガティブ例を効果的にマイニングし、分類器のロバスト性を向上させる。
  • RPNとBF間で畳み込み特徴量を共有することで、1枚あたり0.5秒のテスト時間で効率的な推論を実現する。

実験結果

リサーチクエスチョン

  • RQ1Faster R-CNNが一般物体検出で成功を収めているにもかかわらず、なぜ歩行者検出では強い性能を発揮できないのか?
  • RQ2Faster R-CNNが小スケールの歩行者インスタンスに適用された際の主な制限要因は何か?
  • RQ3歩行者検出におけるRPNモジュールの性能は、完全なFaster R-CNNパイプラインと比べてどの程度か?
  • RQ4高解像度特徴量とハードネガティブ例マイニングは、歩行者検出精度の向上にどの程度寄与しているのか?
  • RQ5完全にディープラーニングベースの手法が、手作業特徴量とディープ特徴量をハイブリッドに組み合わせた手法を上回ることができるか?

主な発見

  • RPN単体でも競争力のある歩行者検出性能を達成しており、根本的な問題は後続のFast R-CNN分類器に起因していることが示された。
  • Caltechにおいては、元のアノテーションを用いた場合に9.6%の平均リcall(MR)、修正済みアノテーションを用いた場合に7.3% MR-2を達成し、手作業特徴量を一切使用しないすべての先行手法を上回った。
  • CaltechでIoU閾値が0.7の場合、23.5%のMRを達成し、最も近い競合手法と比較して相対的に40%の向上を示し、優れた局所化精度を実現した。
  • INRIAでは6.9%のMRを達成し、以前の最高水準(11.2%)を大きく上回った。
  • ETHでは30.2%のMRを達成し、以前の最高手法(TA-CNN)と比較して5ポイントの改善を達成した。
  • KITTIでは、Easyで77.12%のmAP、Moderateで61.15%、Hardで55.12%を達成し、1枚あたり0.6秒の推論時間で、競争力のある速度と精度を両立した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。