[논문 리뷰] YOLOv5s-BC: An improved YOLOv5s-based method for real-time apple detection
이 논문은 실시간 사과 검출을 위한 YOLOv5s-BC를 제안한다. 이는 백본에 좌표 주의( Coordinate Attention) 블록을 통합하고, 특징 융합을 향상시키기 위해 BiFPN 네cks를 사용하며, 작은 사과와 먼 거리의 사과에 대한 검출을 향상시키기 위해 수정된 헤드를 통합한 YOLOv5s 기반 모델이다. 이 모델은 YOLOv5s 대비 4.6%의 mAP 향상을 달성했으며, 16.7 Mb의 모델 크기로 0.018초당 이미지 1장의 실시간 추론 성능을 유지한다.
To address the issues associated with the existing algorithms for the current apple detection, this study proposes an improved YOLOv5s-based method, named YOLOv5s-BC, for real-time apple detection, in which a series of modifications have been introduced. Firstly, a coordinate attention (CA) block has been incorporated into the backbone module to construct a new backbone network. Secondly, the original concatenation operation has been replaced with a bidirectional feature pyramid network (BiFPN) in the neck module. Lastly, a new detection head has been added to the head module, enabling the detection of smaller and more distant targets within the field of view of the robot. The proposed YOLOv5s-BC model was compared to several target detection algorithms, including YOLOv5s, YOLOv4, YOLOv3, SSD, Faster R-CNN (ResNet50), and Faster R-CNN (VGG), with significant improvements of 4.6%, 3.6%, 20.48%, 23.22%, 15.27%, and 15.59% in mAP, respectively. The detection accuracy of the proposed model is also greatly enhanced over the original YOLOv5s model. The model boasts an average detection speed of 0.018 seconds per image, and the weight size is only 16.7 Mb with 4.7 Mb smaller than that of YOLOv8s, meeting the real-time requirements for the picking robot. Furthermore, according to the heat map, our proposed model can focus more on and learn the high-level features of the target apples, and recognize the smaller target apples better than the original YOLOv5s model. Then, in other apple orchard tests, the model can detect the pickable apples in real time and correctly, illustrating a decent generalization ability.
연구 동기 및 목표
- 실제 농장 환경에서 작은 사과와 먼 거리의 사과를 검출하는 데 있어 기존 YOLO 기반 모델의 한계를 해결하기 위해.
- 로봇 수확 응용 프로그램을 위한 실시간 추론 속도를 유지하면서도 소형 타깃의 검출 정확도를 향상시키기 위해.
- 복잡한 농장 환경에서의 일반화 능력을 향상시키기 위해 네트워크 아키텍처 내에서 특징 표현과 특징 융합을 개선하기 위해.
- 성능을 훼손하지 않은 채 모델 크기를 줄여 자원이 제한된 로봇 시스템에의 배포를 가능하게 하기 위해.
제안 방법
- 목표 물체의 공간 좌표에 초점을 맞추어 특징 학습을 향상시키기 위해 YOLOv5s 백본에 좌표 주의(Coordinate Attention) 블록을 통합하였다.
- 네cks의 기존 특징 융합 연산을 이중 방향 특징 피라미드 네트워크(BiFPN)로 대체하여 다중 척도 특징 집합을 향상시켰다.
- 수용 영역과 특징 민감도를 향상시켜 작은 사과와 먼 거리의 사과를 더 잘 국소화하고 분류할 수 있도록 새로운 검출 헤드를 설계하였다.
- 실시간 추론을 위해 전체 네트워크 아키텍처를 최적화하여 저지연성과 임베디드 로봇 시스템에 적합한 컴act한 모델 크기를 확보하였다.
- 주의 메커니즘과 특징 피라미드 정련의 조합을 활용하여 어려운 조명 조건과 가림 상황에서도 검출의 강건성을 향상시켰다.
실험 결과
연구 질문
- RQ1YOLOv5s에 좌표 주의를 통합하면 농장 환경에서 작은 사과와 먼 거리의 사과 검출 정확도가 향상되는가?
- RQ2기존 특징 융합 방식을 BiFPN로 대체하면 다중 척도 특징 표현과 검출 성능이 향상되는가?
- RQ3수정된 검출 헤드가 원래 YOLOv5s 헤드 대비 소형 타깃의 국소화 능력에 얼마나 기여하는가?
- RQ4YOLOv4, YOLOv3, SSD, Faster R-CNN 변종과 같은 최신 기술 대비 YOLOv5s-BC 아키텍처의 mAP와 추론 속도는 어떻게 비교되는가?
- RQ5제안된 모델는 더 높은 정확도와 더 작은 모델 크기를 확보하면서도 실시간 추론 속도를 유지하는가?
주요 결과
- YOLOv5s-BC는 사과 검출 벤치마크에서 원래 YOLOv5s 모델 대비 4.6%의 절대적인 mAP 향상을 달성하였다.
- YOLOv4 대비 3.6%의 mAP 향상, YOLOv3 대비 20.48%, SSD 대비 23.22%, Faster R-CNN (ResNet50) 대비 15.27%, Faster R-CNN (VGG) 대비 15.59%의 mAP 향상을 기록하였다.
- 모델의 평균 추론 속도는 1장당 0.018초로, 로봇 수확 시스템의 실시간 요구 조건을 충족하였다.
- 모델 크기는 16.7 Mb로 축소되어 YOLOv8s보다 4.7 Mb 작아졌으며, 엣지 장치에의 배포 가능성을 높였다.
- 히트맵 시각화 결과, YOLOv5s-BC는 원래 YOLOv5s에 비해 특히 작은 사과와 먼 거리의 사과에 대해 더 높은 수준의 특징에 집중하는 것으로 확인되었다.
- 실제 농장 환경에서의 현장 테스트를 통해 모델이 정확하고 실시간으로 수확 가능한 사과를 탐지할 수 있음을 확인하였으며, 강력한 일반화 능력을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.