[논문 리뷰] Enhanced Self-Checkout System for Retail Based on Improved YOLOv10
이 논문은 YOLOv8의 검출 헤드를 통합하고 이중 컨볼루션 기반의 C2f_Dual모듈 및 효율적인 다중 스케일 주의(Efficient Multi-Scale Attention, EMA)를 도입하여, 유통업계 자가 체크아웃 시스템을 위한 경량이며 고정확도의 객체 검출 모델인 MidState-YOLO-ED를 제안한다. 이 모델은 오직 330만 파라미터와 9.6 GFLOPs로 89%의 mAP@0.5 및 69.1%의 mAP@0.5:0.95를 달성하여, 정확도와 효율성 면에서 YOLOv10-n 및 기준 모델들을 크게 능가한다.
With the rapid advancement of deep learning technologies, computer vision has shown immense potential in retail automation. This paper presents a novel self-checkout system for retail based on an improved YOLOv10 network, aimed at enhancing checkout efficiency and reducing labor costs. We propose targeted optimizations to the YOLOv10 model, by incorporating the detection head structure from YOLOv8, which significantly improves product recognition accuracy. Additionally, we develop a post-processing algorithm tailored for self-checkout scenarios, to further enhance the application of system. Experimental results demonstrate that our system outperforms existing methods in both product recognition accuracy and checkout speed. This research not only provides a new technical solution for retail automation but offers valuable insights into optimizing deep learning models for real-world applications.
연구 동기 및 목표
- 기존 유통업계 체크아웃 방식의 비효율성과 높은 노동력 비용 문제를 해결하기 위해.
- 딥 러닝을 활용하여 자가 체크아웃 시스템의 제품 인식 정확도와 검출 속도를 향상시키기 위해.
- 강화된 특징 추출과 낮은 계산 부담을 통해 YOLOv10을 실생활 유통 응용에 최적화하기 위해.
- 자신 체크아웃 환경에 맞게 조정된 후처리 알고리즘을 개발하여 검출 신뢰도를 향상시키기 위해.
- 자원 제약이 있는 엣지 디바이스에 배포 가능한 경량이며 고성능 모델을 개발하기 위해.
제안 방법
- YOLOv8의 검출 헤드 구조를 YOLOv10에 통합하여 MidState-YOLO 네트워크를 구성함으로써 특징 표현력과 검출 정확도를 향상시켰다.
- 기존의 C2f 블록을 이중 컨볼루션 커널로 대체한 C2f_Dualmodule을 제안하여 깊은 층에서의 중복 특징을 감소시키고 특징 학습을 향상시켰다.
- 전역적 맥락 모델링을 향상시키고 유통 제품의 국소화 정확도를 높이기 위해 효율적인 다중 스케일 주의(EMA) 모듈을 통합하였다.
- 자신 체크아웃 환경에서의 검출 결과를 정밀하게 다듬기 위해 맞춤형 후처리 알고리즘을 설계하여 임의 경고와 부정적 경고를 감소시켰다.
- 일관된 하드웨어 및 소프트웨어 환경에서 자체 개발한 유통 제품 데이터셋(RPC)을 기반으로 MidState-YOLO-ED 모델을 훈련 및 평가하였다.
- 성능 향상을 검증하기 위해 SSD, Faster R-CNN, YOLOv8-n, YOLOv10-n을 기준 모델로 삼아 탈락 연구 및 비교 실험을 수행하였다.
실험 결과
연구 질문
- RQ1YOLOv8의 검출 헤드를 YOLOv10에 통합하면 유통 제품 인식에 있어 검출 정확도가 향상되는가?
- RQ2C2f_Dualmodule은 유통 객체 검출에서 모델 파라미터를 얼마나 줄이고 특징 표현을 얼마나 향상시키는가?
- RQ3EMA 모듈은 소형 및 복잡한 유통 제품 인스턴스에 대해 모델 성능 향상에 얼마나 효과적인가?
- RQ4제안된 후처리 알고리즘은 실생활 자가 체크아웃 환경에서 임의 경고를 상당히 감소시키는가?
- RQ5MidState-YOLO-ED 모델은 기존 YOLO 변종 대비 정확도, 추론 속도, 모델 크기 간의 균형을 더 잘 달성하는가?
주요 결과
- MidState-YOLO-ED는 mAP@0.5에서 89.0%와 mAP@0.5:0.95에서 69.1%를 달성하여 YOLOv10-n 대비 mAP에서 23.2%포인트 향상되었다.
- 모델은 파라미터를 328만 개로 줄이고 GFLOPs를 9.6으로 낮혀 엣지 디바이스 및 실시간 시스템에 배포하기에 적합하다.
- C2f_Dualmodule은 YOLOv10-n 대비 파라미터를 15만 개 감소시켰으며, 정밀도와 재현율은 각각 2.3%포인트와 1.6%포인트 향상되었다.
- EMA 모듈은 mAP@0.5에서 4.2% 향상 기여하여 전역 맥락을 포착하고 잘못된 예측을 줄이는 데 효과적임을 입증하였다.
- YOLOv8-n과 비교했을 때, MidState-YOLO-ED는 훨씬 적은 파라미터와 낮은 FLOPs로도 더 높은 정밀도(84.7% 대 82.4%)와 재현율(82.5% 대 80.9%)을 달성하였다.
- 탈락 연구 결과, YOLOv8과 YOLOv10 아키텍처를 조합하고 제안된 모듈을 통합할 경우 최고의 종합 성능을 달성함을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.