Skip to main content
QUICK REVIEW

[논문 리뷰] Is Faster R-CNN Doing Well for Pedestrian Detection?

Zhang Li-liang, Liang Lin|arXiv (Cornell University)|2016. 07. 24.
Advanced Neural Network Applications참고 문헌 28인용 수 7
한 줄 요약

이 논문은 고해상도 특징에서 Region Proposal Network(RPN)과 이후에 연결된 캐스케이드된 Boosted Forests(BF)를 사용하여 간단하면서도 효과적인 보행자 검출 베이스라인을 제안한다. 이는 Faster R-CNN이 소형 객체 및 어려운 음성 예측에 대처하는 데에 한계를 보이는 점을 보완한다. 이 방법은 Caltech, INRIA, ETH, KITTI 벤치마크에서 최신 기술 수준의 정확도를 달성하며, 이미지당 0.5초의 추론 시간과 Caltech에서 IoU 0.7 기준으로 국소화 정확도가 40% 향상되었다.

ABSTRACT

Detecting pedestrian has been arguably addressed as a special topic beyond general object detection. Although recent deep learning object detectors such as Fast/Faster R-CNN [1, 2] have shown excellent performance for general object detection, they have limited success for detecting pedestrian, and previous leading pedestrian detectors were in general hybrid methods combining hand-crafted and deep convolutional features. In this paper, we investigate issues involving Faster R-CNN [2] for pedestrian detection. We discover that the Region Proposal Network (RPN) in Faster R-CNN indeed performs well as a stand-alone pedestrian detector, but surprisingly, the downstream classifier degrades the results. We argue that two reasons account for the unsatisfactory accuracy: (i) insufficient resolution of feature maps for handling small instances, and (ii) lack of any bootstrapping strategy for mining hard negative examples. Driven by these observations, we propose a very simple but effective baseline for pedestrian detection, using an RPN followed by boosted forests on shared, high-resolution convolutional feature maps. We comprehensively evaluate this method on several benchmarks (Caltech, INRIA, ETH, and KITTI), presenting competitive accuracy and good speed. Code will be made publicly available.

연구 동기 및 목표

  • Faster R-CNN이 일반 객체 검출에서 뛰어난 성능을 보임에도 불구하고 보행자 검출에서 성능이 열등한 이유를 조사한다.
  • 보행자 검출에 적용했을 때 Faster R-CNN의 성능 저하 원인, 특히 소형 객체 처리 및 어려운 음성 예측에서의 한계를 특정한다.
  • 수작업 특징을 고해상도 특징과 효과적인 부스팅 기반 기반으로 대체하는 단순한 엔드 투 엔드 딥 러닝 기반 베이스라인을 개발한다.
  • 고해상도 특징과 어려운 음성 예측이 보행자 검출 정확도 향상에 수작업 특징보다 더 중요하다는 것을 입증한다.

제안 방법

  • Faster R-CNN의 Region Proposal Network(RPN)을 독립형 검출기로 사용하여 후보 제안을 생성한다.
  • 작은 보행자 인스턴스의 표현을 향상시키기 위해 얕은, 고해상도 컨볼루션 레이어에서 특징을 풀링한다.
  • 'à trous'(확장된) 컨볼루션 기법을 사용하여 파rameter 수를 늘리지 않고도 특징 맵 해상도를 높인다.
  • 분류를 위해 캐스케이드된 Boosted Forests(BF)를 적용하며, RPN에서 공유된 고해상도 특징을 활용하여 계산량을 줄이고 일반화 성능을 향상시킨다.
  • BF의 내장된 부스팅 및 샘플 재가중 기법을 활용하여 어려운 음성 예측을 효과적으로 탐색하고 분류기의 강건성을 향상시킨다.
  • RPN과 BF 간에 컨볼루션 특징을 공유하여, 이미지당 0.5초의 테스트 시간을 확보한 효율적인 추론을 가능하게 한다.

실험 결과

연구 질문

  • RQ1Faster R-CNN이 일반 객체 검출에서 성공을 거두었음에도 불구하고 보행자 검출에서 강력한 성능을 내지 못하는 이유는 무엇인가?
  • RQ2소규모 보행자 인스턴스에 적용했을 때 Faster R-CNN의 핵심 한계는 무엇인가?
  • RQ3보행자 검출에서 RPN 컴ponent의 성능이 전체 Faster R-CNN 파이프라인과 비교해 어떻게 다른가?
  • RQ4고해상도 특징과 어려운 음성 예측이 보행자 검출 정확도 향상에 기여하는 정도는 어느 정도인가?
  • RQ5수작업 특징과 딥 러닝 특징을 혼합한 방법보다 순수 딥 러닝 기반 방법이 성능에서 뛰어날 수 있는가?

주요 결과

  • RPN만으로도 경쟁 가능한 보행자 검출 성능를 달성하여, 핵심 문제점이 후속 Fast R-CNN 분류기에 있음을 시사한다.
  • 원래 annotation을 사용한 Caltech에서 평균 재현율(MR)은 9.6%이며, 수정된 annotation을 사용한 MR-2는 7.3%로, 수작업 특징 없이도 이전 모든 방법을 능가한다.
  • Caltech에서 IoU 임계값 0.7 기준으로 23.5% MR를 달성하여, 가장 가까운 경쟁자 대비 40% 상대적 향상으로 뛰어난 국소화 정확도를 입증한다.
  • INRIA에서 6.9% MR를 기록하여 이전 최고 성능인 11.2%보다 뚜렷이 뛰어나다.
  • ETH에서 30.2% MR를 기록하여 이전 최고 성능인 TA-CNN 대비 5포인트 향상되었다.
  • KITTI에서 Easy는 77.12% mAP, Moderate는 61.15%, Hard는 55.12%를 기록하며, 이미지당 0.6초의 추론 시간을 확보하여 경쟁력 있는 속도와 정확도를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.