[논문 리뷰] Efficient Object Detection Model for Real-Time UAV Applications
이 논문은 백본으로 MobileNet을 사용하고, 수정된 포칼 손실 함수를 적용한 Deep Feature Pyramid Network(DFPN)을 사용하여 경량이며 실시간 객체 탐지 모델을 제안한다. 실제 드론 하드웨어에서 14 fps에서 29.2 mAP를 달성하며, RetinaNet과 HAL-RetinaNet보다도 빠른 속도와 높은 효율성을 확보하면서도 뛰어난 정확도와 낮은 전력 소비를 유지한다.
Unmanned Aerial Vehicles (UAVs) especially drones, equipped with vision techniques have become very popular in recent years, with their extensive use in wide range of applications. Many of these applications require use of computer vision techniques, particularly object detection from the information captured by on-board camera. In this paper, we propose an end to end object detection model running on a UAV platform which is suitable for real-time applications. We propose a deep feature pyramid architecture which makes use of inherent properties of features extracted from Convolutional Networks by capturing more generic features in the images (such as edge, color etc.) along with the minute detailed features specific to the classes contained in our problem. We use VisDrone-18 dataset for our studies which contain different objects such as pedestrians, vehicles, bicycles etc. We provide software and hardware architecture of our platform used in this study. We implemented our model with both ResNet and MobileNet as convolutional bases. Our model combined with modified focal loss function, produced a desirable performance of 30.6 mAP for object detection with an inference time of 14 fps. We compared our results with RetinaNet-ResNet-50 and HAL-RetinaNet and shown that our model combined with MobileNet as backend feature extractor gave the best results in terms of accuracy, speed and memory efficiency and is best suitable for real time object detection with drones.
연구 동기 및 목표
- 자원 제약이 있는 UAV 플랫폼에 실시간 배포에 적합한 계산 비용이 낮고 메모리가 가벼운 객체 탐지 모델을 개발하기 위해.
- 작은 객체나 드문 객체에 대한 성능 향상을 위해 클래스 불균형 문제를 해결하기 위해 수정된 포칼 손실 함수를 적용하기 위해.
- 임베디드 UAV 하드웨어에서 정확도를 훼손하지 않고 추론 속도와 전력 효율성을 최적화하기 위해.
- mAP, 속도, 에너지 소비 측면에서 ResNet과 MobileNet 백본을 사용한 모델의 성능을 평가하고 비교하기 위해.
- 실제 멀티로터 드론에 모델를 배포하고 VisDrone’18 데이터셋을 사용하여 실제 항공 객체 탐지 환경에서 검증하기 위해.
제안 방법
- 다양한 크기의 객체 탐지를 향상시키기 위해 컨볼루션 레이어에서 유도된 다중 스케일 특징을 융합함으로써 특징 표현을 향상시키는 Deep Feature Pyramid Network(DFPN)을 제안하였다.
- 모델 크기와 계산 비용을 줄이고 속도 및 메모리 효율성을 향상시키기 위해 백본으로 MobileNet을 사용하였다.
- 드문 또는 작은 객체에 특히 효과적으로 작용하도록 클래스 불균형 문제를 완화하기 위해 수정된 포칼 손실 함수를 통합하였다.
- 다양한 항공 객체, 예를 들어 보행자, 차량, 자전거 등을 포함한 VisDrone’18 데이터셋을 사용하여 모델을 훈련시켰다.
- 실시간 추론을 위해 실제 멀티로터 드론에 장착된 NVIDIA Jetson TX2 임베디드 플랫폼에 훈련된 모델을 배포하였다.
- 실시간 구현 가능성과 효율성을 평가하기 위해 mAP, 추론 속도(fps), 전력 소모를 측정하였다.
실험 결과
연구 질문
- RQ1자원 제약이 있는 임베디드 UAV 하드웨어에서 실시간 추론(≥10 fps)을 달성하면서도 높은 mAP 성능을 유지할 수 있는가?
- RQ2DFPN과 수정된 포칼 손실 함수의 조합이 항공 영상에서 작은 객체나 드문 객체에 대해 정확도를 어떻게 향상시키는가?
- RQ3MobileNet과 ResNet을 백본으로 사용할 경우, 정확도, 추론 속도, 모델 크기 사이의 상호 교환 관계는 어떻게 되는가?
- RQ4VisDrone’18 벤치마크에서 최신 기술인 RetinaNet과 HAL-RetinaNet과 비교해 본 모델의 성능 및 효율성은 어떠한가?
- RQ5드론 플랫폼에서 모델이 전력 소모와 메모리 프로파일을 얼마나 줄여주며, 이를 통해 비행 시간을 얼마나 연장할 수 있는가?
주요 결과
- MobileNet을 백본으로 사용한 모델은 14 fps의 추론 속도를 달성하여 UAV 애플리케이션에 실시간 요구 조건을 충족시켰다.
- VisDrone’18 데이터셋에서 29.2 mAP의 성능을 기록하여 RetinaNet(23 mAP)을 초월하고 HAL-RetinaNet(31.8 mAP)에 근접한 정확도를 확보하였다.
- MobileNet 기반 모델은 파라미터 수를 135억 개로 줄이고 전력 소모를 85W로 낮혀 에너지 효율성과 메모리 프로파일을 크게 향상시켰다.
- DFPN 아키텍처는 다중 스케일 특징 융합를 통해 특징 표현을 향상시켜 작은 객체나 가림을 받은 객체의 탐지 성능을 향상시켰다.
- 수정된 포칼 손실 함수는 드문 객체 카테고리에 대한 영향을 효과적으로 줄여 탐지 신뢰도를 향상시켰다.
- 모델은 실생활 환경에서 뛰어난 성능을 보였으며, 높은 신뢰도로 실시간 드론 촬영 항공 영상에서 객체를 성공적으로 탐지하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.