[논문 리뷰] YOLO v3: Visual and Real-Time Object Detection Model for Smart Surveillance Systems(3s)
이 논문은 MS COCO 데이터셋에서 전이 학습을 사용하여 YOLO v3 기반 실시간 객체 탐지 모델을 스마트 감시 시스템(3s)에 제안하며, 99.71%의 정확도와 mAP 61.5의 성능을 달성하였다. 모델는 YOLO v3의 다중 척도 특징 추출 및 Darknet-53 백본을 활용하여 훈련 시간과 계산 비용을 줄이며 실제 감시 영상에서 효율적이고 고정밀도의 탐지를 가능하게 한다.
Can we see it all? Do we know it All? These are questions thrown to human beings in our contemporary society to evaluate our tendency to solve problems. Recent studies have explored several models in object detection; however, most have failed to meet the demand for objectiveness and predictive accuracy, especially in developing and under-developed countries. Consequently, several global security threats have necessitated the development of efficient approaches to tackle these issues. This paper proposes an object detection model for cyber-physical systems known as Smart Surveillance Systems (3s). This research proposes a 2-phase approach, highlighting the advantages of YOLO v3 deep learning architecture in real-time and visual object detection. A transfer learning approach was implemented for this research to reduce training time and computing resources. The dataset utilized for training the model is the MS COCO dataset which contains 328,000 annotated image instances. Deep learning techniques such as Pre-processing, Data pipelining, and detection was implemented to improve efficiency. Compared to other novel research models, the proposed model's results performed exceedingly well in detecting WILD objects in surveillance footages. An accuracy of 99.71% was recorded, with an improved mAP of 61.5.
연구 동기 및 목표
- 개발 및 개발도상국에서의 수동 감시의 비효율성을 해결하기 위해 지능형 실시간 객체 탐지 시스템을 제안한다.
- 특히 YOLO v3를 활용한 딥러닝을 통해 스마트 감시 시스템의 객체 탐지 정확도와 속도를 향상시킨다.
- MS COCO 데이터셋에 대한 전이 학습을 통해 훈련 시간과 계산 자원 요구량을 감소시킨다.
- 사이버-물리 시스템 프레임워크를 활용하여 다양한 실제 환경(WILD)의 객체를 감시 영상에서 견고하게 탐지할 수 있도록 한다.
- 비디오 스트림에서 무기, 도난, 화재 폭발과 같은 위협을 자동으로 정확하고 신속하게 탐지함으로써 보안을 향상시킨다.
제안 방법
- 특징 피라미드 네트워크(FPN)를 사용하여 실시간 단일 스크린 객체 탐지를 위한 YOLO v3 아키텍처와 Darknet-53 백본을 활용한다.
- 사전 훈련된 ImageNet 가중치를 사용하여 MS COCO 데이터셋에서 수렴 속도를 가속화하고 훈련 시간을 단축시킨다.
- 데이터 전처리, 데이터 파ip라이닝 및 배치 처리를 구현하여 추론 속도와 모델 효율성을 최적화한다.
- 다양한 크기의 객체를 감시 영상에서 탐지하기 위해 3개의 스케일에서 특징 맵을 통한 다중 척도 예측을 적용한다.
- 중복을 줄이기 위해 비최대 억제(NMS)와 IoU(교차 영역) 임계값 설정을 적용하여 바운딩 박스 예측을 정밀하게 조정한다.
- 실제 와일드 환경에서 수집한 감시 영상 자료를 사용하여 모델을 훈련 및 평가하여 실제 환경 조건을 시뮬레이션한다.
![Figure 1: YOLO v3 vs. RetinaNet: Speed/Accuracy Chart [ 6 ]](https://ar5iv.labs.arxiv.org/html/2209.12447/assets/Figures/graph.jpg)
실험 결과
연구 질문
- RQ1자원이 제한된 환경에서 YOLO v3 기반 모델이 스마트 감시 시스템의 객체 탐지에 대해 높은 정확도와 실시간 성능을 달성할 수 있는가?
- RQ2MS COCO 데이터셋에 적용된 전이 학습이 감시 응용 분야에서 훈련 효율성과 탐지 정확도에 어떤 영향을 미치는가?
- RQ3YOLO v3가 감시 영상에서 다양한 실제 환경의 객체를 탐지할 때 기존 모델인 Faster R-CNN과 SSD보다 어느 정도 뛰어난가?
- RQ4실제 와일드 환경 감시 영상에서 제안된 모델의 mAP 및 정확도 성능은 어떠한가?
- RQ5YOLO v3를 사이버-물리 시스템 프레임워크와 통합함으로써 저지연, 고정밀도의 확장 가능한 지능형 감시를 실현할 수 있는가?
주요 결과
- 제안된 YOLO v3 모델은 실제 감시 영상 자료에서 99.71%의 탐지 정확도를 기록하여 기존 모델들을 크게 능가하였다.
- 모델는 평균 평균 정밀도(mAP) 61.5를 기록하여 다양한 객체 유형에 걸쳐 강력한 일반화 능력과 탐지 능력을 입증하였다.
- 비교 평가 결과, 동일한 테스트 환경에서 기존 모델인 Faster R-CNN(95.4%)과 커스터마이즈된 YOLO v3(98.89%)를 모두 초월하였다.
- 전이 학습의 적용으로 훈련 시간과 계산 자원 요구량을 감소시켰지만 높은 탐지 성능을 유지하였다.
- 다양한 테스트 영상에서 높은 성능을 보였으며, 대부분의 경우 정밀도와 재현율 값이 0.92를 초과하였다.
- 그림 12의 시각적 애너테이션은 복잡한 실시간 감시 프레임에서 객체의 정확한 국소화 및 분류를 확인하였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.