[논문 리뷰] Rethinking Object Detection in Retail Stores
이 논문은 소매 환경에서 동시 객체 국소화 및 세기 작업인 Locount을 도입하며, 140개 카테고리에 걸쳐 50,394장의 이미지와 190만 개 이상의 인스턴스를 포함하는 새로운 벤치마크를 제안한다. 이는 종합적으로 최적화된 국소화 및 세기 네트워크를 제안하며, 새로운 데이터셋에서 최신 기술 성능을 달성한다. 이 데이터셋은 연구를 위해 공개되어 있다.
The convention standard for object detection uses a bounding box to represent each individual object instance. However, it is not practical in the industry-relevant applications in the context of warehouses due to severe occlusions among groups of instances of the same categories. In this paper, we propose a new task, ie, simultaneously object localization and counting, abbreviated as Locount, which requires algorithms to localize groups of objects of interest with the number of instances. However, there does not exist a dataset or benchmark designed for such a task. To this end, we collect a large-scale object localization and counting dataset with rich annotations in retail stores, which consists of 50,394 images with more than 1.9 million object instances in 140 categories. Together with this dataset, we provide a new evaluation protocol and divide the training and testing subsets to fairly evaluate the performance of algorithms for Locount, developing a new benchmark for the Locount task. Moreover, we present a cascaded localization and counting network as a strong baseline, which gradually classifies and regresses the bounding boxes of objects with the predicted numbers of instances enclosed in the bounding boxes, trained in an end-to-end manner. Extensive experiments are conducted on the proposed dataset to demonstrate its significance and the analysis discussions on failure cases are provided to indicate future directions. Dataset is available at https://isrc.iscas.ac.cn/gitlab/research/locount-dataset.
연구 동기 및 목표
- 개별 바운딩 박스가 비현실적인 고도로 겹치는 소매 환경에서 기존 물체 검출 기법의 한계를 해결하기 위해.
- 밀도 높은 물체 그룹이 존재하는 실제 소매 환경에 더 적합한, 동시 국소화 및 세기(Locount) 작업을 제안하기 위해.
- 140개 카테고리에 걸쳐 50,394장의 이미지와 190만 개 이상의 인스턴스를 포함하는 대규모이고 풍부하게 애너테이션된 데이터셋을 구축하기 위해.
- 알고리즘의 성능 평가를 공정하게 평가하기 위한 새로운 평가 프로토콜을 개발하기 위해.
- 향후 연구를 위한 강력한 종단 간 캐스케이드 네트워크 기반 모델을 확립하기 위해.
제안 방법
- 동일한 카테고리의 물체 그룹에 대해 바운딩 박스와 인스턴스 수를 동시에 예측해야 하는 새로운 작업인 Locount을 제안한다.
- 140개 카테고리에 대해 세밀한 애너테이션을 포함한 50,394장의 소매 이미지로 구성된 대규모 데이터셋을 수집한다.
- 학습 및 테스트 세트를 분리하여 공정한 성능 평가를 보장하는 새로운 평가 프로토콜을 설계한다.
- 각 바운딩 박스 내의 인스턴스 수를 예측하면서 점진적으로 바운딩 박스를 정밀하게 다듬는 캐스케이드 국소화 및 세기 네트워크를 개발한다.
- 국소화 및 세기 정확도를 향상시키기 위해 다단계 회귀 및 분류 헤드를 사용해 모델을 종단 간으로 훈련한다.
- 인스턴스 수 세기 기능을 검출 헤드 내의 회귀 헤드로 통합하여 공동 최적화를 가능하게 한다.
실험 결과
연구 질문
- RQ1통합 모델이 고도로 겹쳐진 소매 환경에서 국소화와 세기 기능을 효과적으로 동시에 수행할 수 있는가?
- RQ2제안된 Locount 벤치마크는 기존의 물체 검출 벤치마크에 비해 실제 적용 가능성 측면에서 어떻게 비교되는가?
- RQ3종단 간 캐스케이드 아키텍처를 사용할 경우 국소화 및 세기 작업의 성능 향상은 어느 정도인가?
- RQ4Locount 작업의 실패 케이스는 현재의 검출 파라다임의 한계를 어떻게 드러내는가?
- RQ5다양한 소매 물체 카테고리 간에 세기 예측을 일반화하는 데 있어 핵심 과제는 무엇인가?
주요 결과
- 50,394장의 이미지와 190만 개 이상의 인스턴스를 포함하는 제안된 Locount 벤치마크는 소매 환경에서의 국소화 및 세기 평가를 위한 종합적인 자원을 제공한다.
- 캐스케이드 국소화 및 세기 네트워크는 새로운 벤치마크에서 베이스라인 검출 모델보다 뛰어난 성능을 달성한다.
- 새로운 평가 프로토콜은 Locount 작업에서 알고리즘 간의 공정하고 재현 가능한 비교를 가능하게 한다.
- 실패 분석을 통해 겹침과 크기 변화는 여전히 주요 과제로 드러나며, 특히 작은 물체나 고밀도로 배치된 물체에서 두드러진다.
- 데이터셋과 벤치마크는 https://isrc.iscas.ac.cn/gitlab/research/locount-dataset 에 공개되어 향후 연구를 지원한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.