Skip to main content
QUICK REVIEW

[논문 리뷰] Improved Person Detection on Omnidirectional Images with Non-maxima Suppression

Roman Seidel, André Apitzsch|arXiv (Cornell University)|2018. 05. 22.
Advanced Neural Network Applications참고 문헌 19인용 수 18
한 줄 요약

이 논문은 옴니디렉셔널 이미지에서 YOLOv2를 피시온 이미지에 적합하도록 조정하여 가상의 시점 시각을 활용한 사람 검출 방법을 제안한다. 검출 결과를 역투영하고 가우시안 스무딩을 적용한 소프트 비최대 억제를 통해, PIROPO에서 64.6%의 평균 정밀도와 Flat 데이터셋에서 77.6%의 평균 정밀도를 달성하여 기준 YOLOv2 및 표준 NMS보다 유의미하게 향상시켰다.

ABSTRACT

We propose a person detector on omnidirectional images, an accurate method to generate minimal enclosing rectangles of persons. The basic idea is to adapt the qualitative detection performance of a convolutional neural network based method, namely YOLOv2 to fish-eye images. The design of our approach picks up the idea of a state-of-the-art object detector and highly overlapping areas of images with their regions of interests. This overlap reduces the number of false negatives. Based on the raw bounding boxes of the detector we fine-tuned overlapping bounding boxes by three approaches: non-maximum suppression, soft non-maximum suppression and soft non-maximum suppression with Gaussian smoothing. The evaluation was done on the PIROPO database and an own annotated Flat dataset, supplemented with bounding boxes on omnidirectional images. We achieve an average precision of 64.4 % with YOLOv2 for the class person on PIROPO and 77.6 % on Flat. For this purpose we fine-tuned the soft non-maximum suppression with Gaussian smoothing.

연구 동기 및 목표

  • 딥 러닝을 활용하여 옴니디렉셔널(180°) 피시온 이미지에서 정확한 사람 검출을 수행하는 데 도전한다.
  • 편평한 시점 이미지에서 훈련된 표준 객체 검출기의 성능가 장애를 해결하기 위해, 왜곡된 옴니디렉셔널 시각에 직접 적용했을 때의 한계를 극복한다.
  • 중복되는 검출 결과의 정교한 후처리를 통해 가짜 음성(false negatives)을 줄이고 바운딩 박스의 품질을 향상시킨다.
  • 옴니디렉셔널 이미지 검출에 대해 다양한 비최대 억제(NMS) 변형의 성능을 평가한다.
  • 새로운 주석이 추가된 데이터셋(Flat)을 구축하고 활용하며, PIROPO 데이터베이스를 기준으로 성능을 평가한다.

제안 방법

  • 작은 간격으로 아즈임스 및 엘레베이션 각도를 샘플링하여 옴니디렉셔널 이미지에서 매우 겹치는 가상의 시점 시각을 생성한다.
  • 각 가상의 시점 시각에 YOLOv2를 적용하여 원시 검출 바운딩 박스를 확보한다.
  • 검출된 바운딩 박스를 시점 좌표계에서 원래의 옴니디렉셔널 이미지 좌표계로 역투영한다.
  • 세 가지 후처리 방법을 적용한다: 표준 NMS, 소프트 NMS, 소프트 NMS에 가우시안 스무딩을 추가한 방법을 통해 중복 검출을 정교화한다.
  • 평가를 위해 PASCAL VOC 기준으로 IoU 임계값 0.5를 사용한다.
  • 신뢰도 점수와 IoU 겹침 비율을 기반으로 억제 방법을 정 fine-tune하여 중복 및 과도한 크기의 박스를 최소화한다.

실험 결과

연구 질문

  • RQ1적응 조정 없이 옴니디렉셔널 이미지에 직접 YOLOv2를 적용했을 때 사람 검출 성능이 어떻게 저하되는가?
  • RQ2가상의 시점 시각은 옴니디렉셔널 이미지에서 검출 정확도를 얼마나 향상시킬 수 있는가?
  • RQ3비최대 억제의 어떤 변형—표준, 소프트, 또는 소프트에 가우시안 스무딩을 추가한 것—이 옴니디렉셔널 데이터에서 가장 높은 검출 성능을 내는가?
  • RQ4특히 PIROPO와 새로 구축한 Flat 데이터셋 간의 검출 결과는 어떻게 비교되는가?
  • RQ5렌즈 왜곡과 축이 평행하지 않은 특성은 옴니디렉셔널 검출에서 바운딩 박스 품질에 어떤 영향을 미치는가?

주요 결과

  • 가우시안 스무딩을 적용한 소프트 비최대 억제는 사람 클래스에 대해 PIROPO 데이터셋에서 최고의 평균 정밀도 64.6%를 달성했다.
  • 새로운 Flat 데이터셋에서는 동일한 방법이 77.6%의 평균 정밀도를 기록하여 다른 모든 NMS 변형보다 뛰어난 성능을 보였다.
  • 옴니디렉셔널 이미지에 YOLOv2를 직접 적용한 경우(NMS Omni) 평균 정밀도는 단지 41.4%에 그쳐 적응 없이 적용했을 때 성능 저하가 심각한 것으로 나타났다.
  • 가우시안 스무딩을 적용한 소프트-NMS의 PR 곡선은 대부분의 재현율 수준에서 뛰어난 성능을 보였으며, 특히 재현율 0.35에서 0.75 사이에서는 높은 정밀도를 유지했다.
  • 표준 NMS와 소프트-NMS는 거의 동일한 PR 곡선을 보였으며, 정밀도가 0.2 이하일 경우에만 미세한 차이가 있었다.
  • 겹치는 가상의 시점 시각을 활용함으로써 이 방법은 가짜 음성(false negatives)을 효과적으로 줄였으며, 여러 투영에서 사람을 검출할 가능성을 높였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.