[논문 리뷰] FishEye8K: A Benchmark and Dataset for Fisheye Camera Object Detection
이 논문은 대만 허신취 현에 위치한 18개의 감시 카메라에서 촬영한 8,000장의 피시아이 카메라 이미지와 5개의 도로 객체 클래스(Pedestrian, Bike, Car, Bus, Truck)에 대한 157,000개의 바운딩 박스를 포함하는 새로운 오픈 벤치마크 데이터셋인 FishEye8K를 소개한다. 최신 YOLO 모델을 평가한 결과, YOLOv8과 YOLOR가 가장 높은 mAP를 기록하여 극단적인 왜곡과 클래스 불균형으로 인한 도전 과제가 존재하더라도 피시아이 기반 스마트 시티 및 영상 분석 응용 분야의 기초를 다진다.
With the advance of AI, road object detection has been a prominent topic in computer vision, mostly using perspective cameras. Fisheye lens provides omnidirectional wide coverage for using fewer cameras to monitor road intersections, however with view distortions. To our knowledge, there is no existing open dataset prepared for traffic surveillance on fisheye cameras. This paper introduces an open FishEye8K benchmark dataset for road object detection tasks, which comprises 157K bounding boxes across five classes (Pedestrian, Bike, Car, Bus, and Truck). In addition, we present benchmark results of State-of-The-Art (SoTA) models, including variations of YOLOv5, YOLOR, YOLO7, and YOLOv8. The dataset comprises 8,000 images recorded in 22 videos using 18 fisheye cameras for traffic monitoring in Hsinchu, Taiwan, at resolutions of 1080$ imes$1080 and 1280$ imes$1280. The data annotation and validation process were arduous and time-consuming, due to the ultra-wide panoramic and hemispherical fisheye camera images with large distortion and numerous road participants, particularly people riding scooters. To avoid bias, frames from a particular camera were assigned to either the training or test sets, maintaining a ratio of about 70:30 for both the number of images and bounding boxes in each class. Experimental results show that YOLOv8 and YOLOR outperform on input sizes 640$ imes$640 and 1280$ imes$1280, respectively. The dataset will be available on GitHub with PASCAL VOC, MS COCO, and YOLO annotation formats. The FishEye8K benchmark will provide significant contributions to the fisheye video analytics and smart city applications.
연구 동기 및 목표
- 교통 감시에서 피시아이 카메라 기반 2차원 도로 객체 검출을 위한 오픈 소스이자 대규모 데이터셋의 부족을 해결하기 위해.
- 현실적인 왜곡, 다양한 조도 조건, 실제 도시 교차로에서의 다수의 객체 클래스를 포함한 다양하고 익명화된 데이터셋을 구축하기 위해.
- 피시아이 영상에서 최신 기술 수준의 객체 검출 모델 평가를 위한 표준화된 벤치마크를 제공하기 위해.
- 전방위적 피시아이 카메라를 사용한 강력한 영상 분석 및 스마트 시티 응용 분야의 개발을 지원하기 위해.
- 데이터 유출 및 편향을 방지하기 위해 각 카메라별로 훈련 세트와 테스트 세트를 분리함으로써 공정한 평가를 확보하기 위해.
제안 방법
- 대만 허신취 시에 설치된 18대의 피시아이 감시 카메라에서 촬영한 22개의 영상 시퀀스(각각 8~20분)를 수집하여 도시 교차로와 고속도로를 커버한다.
- 수동 레이블링을 정밀하게 수행하여 5개 클래스(Pedestrian, Bike, Car, Bus, Truck)에 대해 총 8,000장의 이미지 프레임에 157,000개의 바운딩 박스를 주석 처리한다.
- 각 카메라별로 훈련 대 테스트 비율을 70:30으로 유지하여 데이터 유출을 방지하고 세트 간 클래스 분포가 균형을 이루도록 한다.
- 기존 객체 검출 프레임워크와의 광범위한 호환성을 위해 PASCAL VOC, MS COCO, YOLO 등 다양한 표준 형식으로 주석을 제공한다.
- 표준 평가 지표인 mAP, 정밀도, 재현율, 추론 시간을 사용하여 YOLOv5x, YOLOR, YOLOv7, YOLOv8 등의 최신 기술 수준 모델을 데이터셋에서 평가한다.
- 개인정보 보호를 확보하기 위해 얼굴과 번호판을 흐리게 처리하여 데이터 익명화를 적용한다.
실험 결과
연구 질문
- RQ1극도의 반사 왜곡이 있는 피시아이 카메라 영상에서 최신 기술 수준의 객체 검출 모델의 성능은 어떠한가?
- RQ2입력 해상도(640×640 대비 1280×1280)가 피시아이 데이터에서 모델 정확도에 어떻게 영향을 미치는가?
- RQ3피시아이 영상에서 객체 검출기의 주요 실패 원인은 무엇인가, 특히 작은 또는 먼 객체에 대해 나타나는가?
- RQ4클래스 불균형과 영상 왜곡이 다양한 객체 카테고리의 검출 성능에 어떻게 영향을 미치는가?
- RQ5기존 YOLO 기반 모델은 재학습 없이도 피시아이 카메라 데이터에 효과적으로 일반화될 수 있는가?
주요 결과
- YOLOv8과 YOLOR가 FishEye8K 데이터셋에서 가장 높은 mAP를 기록했으며, YOLOv8은 640×640 입력 크기에서 최고의 성능를 보였고, YOLOR는 1280×1280에서 최고 성능를 기록했다.
- 최고 성능 모델(YOLOR-W6)의 mAP@0.5는 Car에 대해 0.8161, Truck에 대해 0.7853, Bike에 대해 0.7422, Bus에 대해 0.6541이었고, Pedestrian는 0.3621이었다.
- Pedestrian 클래스는 가장 낮은 정밀도(0.49)와 가장 높은 거짓 음성 비율(0.72)을 보이며, 작은 또는 먼 사람을 검출하는 데 상당한 과제를 겪고 있음을 시사한다.
- 배경 요소에서의 거짓 양성은 흔한 현상이었으며, Bike 클래스의 65%의 거짓 양성은 사인판이나 건물 등을 자전거로 잘못 식별한 것이었다.
- 고성능 GPU에서 추론 시간은 4.3 ms에서 43.9 ms 사이로 변동하여 실시간 추론 잠재력을 보였다.
- 모든 클래스에서 높은 거짓 음성 비율(0.29~0.72)이 드러났으며, 주로 주차된 차량이나 부분적으로 보이는 차량에서 발생했고, 크기가 작아진 먼 보행자를 자전거로 잘못 식별하는 현상도 관찰되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.