Skip to main content
QUICK REVIEW

[논문 리뷰] Fused DNN: A deep neural network fusion approach to fast and robust pedestrian detection

Xianzhi Du, Mostafa El‐Khamy|arXiv (Cornell University)|2016. 10. 11.
Advanced Neural Network Applications참고 문헌 30인용 수 12
한 줄 요약

이 논문은 빠르고 강건한 보행자 검출을 위한 Fused DNN(F-DNN)이라는 딥 뉴럴 네트워크 융합 프레임워크를 제안한다. 단일 스크린 SSD 검출기를 사용해 다양한 보행자 후보를 생성한 후, 여러 분류기(ResNet-50, GoogleNet)와 의미적 세그멘테이션 네트워크를 소프트 거부 기반으로 융합하여 검출를 정밀화한다. Caltech 'Reasonable' 설정에서 상태최고수준의 정확도(8.65% log-average miss rate)를 달성하면서도 이전 방법보다 1.67배 빠른 성능을 보였다.

ABSTRACT

We propose a deep neural network fusion architecture for fast and robust pedestrian detection. The proposed network fusion architecture allows for parallel processing of multiple networks for speed. A single shot deep convolutional network is trained as a object detector to generate all possible pedestrian candidates of different sizes and occlusions. This network outputs a large variety of pedestrian candidates to cover the majority of ground-truth pedestrians while also introducing a large number of false positives. Next, multiple deep neural networks are used in parallel for further refinement of these pedestrian candidates. We introduce a soft-rejection based network fusion method to fuse the soft metrics from all networks together to generate the final confidence scores. Our method performs better than existing state-of-the-arts, especially when detecting small-size and occluded pedestrians. Furthermore, we propose a method for integrating pixel-wise semantic segmentation network into the network fusion architecture as a reinforcement to the pedestrian detector. The approach outperforms state-of-the-art methods on most protocols on Caltech Pedestrian dataset, with significant boosts on several protocols. It is also faster than all other methods.

연구 동기 및 목표

  • 소형, 가림되거나 붐비는 장면에서 속도와 정확도의 상충 관계를 해결하기 위해.
  • 다양한 딥 뉴럴 네트워크(분류기 및 의미적 세그멘테이션 네트워크 포함)를 융합하여 검출의 강건성을 향상시키기 위해.
  • 하드 이진 결정을 내리지 않고 신뢰도 점수를 향상시키는 소프트 거부 기반 융합 방법을 개발하기 위해.
  • 높은 검출 정확도를 유지하면서도 실시간 추론 속도를 달성하기 위해.
  • 의미적 세그멘테이션과 보행자 검출 간의 상호보완적 상호작용을 탐색하여 정위치 및 분류 성능 향상에 기여하기 위해.

제안 방법

  • 단일 스크린 다중 박스 검출기( SSD )가 높은 재현율을 가지지만 높은 거짓 긍정 비율을 보이는 보행자 후보를 대량 생성한다.
  • 병렬적으로 여러 딥 뉴럴 네트워크 분류기(ResNet-50, GoogleNet)를 적용하여 후보의 신뢰도 점수를 정밀화한다.
  • 새로운 소프트 거부 기반 네트워크 융합(SNF) 방법이 여러 분류기의 소프트 확률을 융합하여 최종 신뢰도 점수를 산출하며, 하드 거부를 방지한다.
  • 확장된 컨볼루션 의미적 세그멘테이션 네트워크를 통합하여 후보 영역에 대해 추가적인 맥락 인식 신뢰도 투표를 제공한다.
  • 모든 구성 요소가 단일 GPU에서 병렬 처리되며, 전체 파이프라인은 가장 느린 요소(예: 2.48초/이미지의 의미적 세그멘테이션)에 의해 제한된다.
  • 검출 및 세그멘테이션 헤드의 공동 최적화를 통해 엔드 투 엔드로 훈련되며, 다중 작업 학습을 활용해 일반화 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1다양한 딥 뉴럴 네트워크의 소프트 거부 융합이 속도를 희생시키지 않고도 보행자 검출 정확도를 향상시킬 수 있는가?
  • RQ2의미적 세그멘테이션 네트워크 통합이 소형 또는 가림된 보행자에 대해 보행자 검출 성능을 어떻게 향상시키는가?
  • RQ3제안된 F-DNN 프레임워크가 Caltech 보행자 데이터셋에서 기존 최고 수준의 방법보다 정확도와 추론 속도 양면에서 뛰어나게 성능을 내는가?
  • RQ4소프트 거부 융합 메커니즘이 하드 거부 또는 단일 모델 접근 방식에 비해 거짓 긍정을 얼마나 효과적으로 줄이는가?
  • RQ5다른 수신장과 아키텍처를 가진 다수의 분류기를 융합함으로써, 가림되거나 해상도가 낮은 장면에서의 강건성을 향상시킬 수 있는가?

주요 결과

  • F-DNN 시스템은 Caltech 'Reasonable' 평가 설정에서 로그 평균 누락률(L-AMR)이 8.65%를 기록하여 이전 최고 성능인 9.58%를 초월했다.
  • 의미적 세그멘테이션 네트워크 통합으로 L-AMR는 8.18%로 추가로 하락하여 어려운 케이스에서 뚜렷한 성능 향상을 보였다.
  • 이전 최고 수준의 방법보다 1.67배 더 빠른 성능을 보이며, 'Reasonable' 설정에서 이미지당 0.16초의 속도를 달성했다.
  • 소프트 거부 융합 방법은 특히 붐비거나 가림된 장면에서 하드 거부보다 더 효과적으로 거짓 긍정을 줄였다.
  • 정성적 비교를 통해 소형 보행자, 가림된 보행자, 흐린 이미지, 붐비는 장면에서 뛰어난 강건성을 보였다.
  • SSD와 GoogleNet을 융합한 경우 이미지당 0.11초로 최고 성능을 달성했으며, SSD와 SqueezeNet을 융합한 경우 이미지당 0.09초(10 FPS 이상)로 빠른 속도를 기록했고, L-AMR ≈ 10.8%를 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.