[논문 리뷰] QueryDet: Cascaded Sparse Query for Accelerating High-Resolution Small Object Detection
QueryDet는 저해상도 특징에서 거친 객체 위치를 먼저 예측한 다음, 해당 위치에서만 고해상도 특징에 대해 희소 계산을 적용하는 계단식 희소 쿼리 메커니즘(CSQ)을 제안한다. 이는 COCO에서 최대 3.0배, VisDrone에서 최대 2.3배의 계산량을 감소시키며, mAP-small을 2.0 향상시켜 최신 기술 수준의 성능을 달성한다.
While general object detection with deep learning has achieved great success in the past few years, the performance and efficiency of detecting small objects are far from satisfactory. The most common and effective way to promote small object detection is to use high-resolution images or feature maps. However, both approaches induce costly computation since the computational cost grows squarely as the size of images and features increases. To get the best of two worlds, we propose QueryDet that uses a novel query mechanism to accelerate the inference speed of feature-pyramid based object detectors. The pipeline composes two steps: it first predicts the coarse locations of small objects on low-resolution features and then computes the accurate detection results using high-resolution features sparsely guided by those coarse positions. In this way, we can not only harvest the benefit of high-resolution feature maps but also avoid useless computation for the background area. On the popular COCO dataset, the proposed method improves the detection mAP by 1.0 and mAP-small by 2.0, and the high-resolution inference speed is improved to 3.0x on average. On VisDrone dataset, which contains more small objects, we create a new state-of-the-art while gaining a 2.3x high-resolution acceleration on average. Code is available at https://github.com/ChenhongyiYang/QueryDet-PyTorch.
연구 동기 및 목표
- 고해상도 특징 맵에서 소형 객체 검출에 따른 높은 계산 비용을 해결하기 위해.
- 특징 피라미드 기반 검출기에서 유의미한 소형 객체 위치에만 집중함으로써 불필요한 계산을 줄이기 위해.
- 소형 객체 검출 정확도를 유지하면서 인fer 속도를 크게 향상시키기 위해.
- 자율주행 차량과 같은 실시간 시스템에 소형 객체 검출기의 효율적 구현을 가능하게 하기 위해.
- 다양한 검출기, 백본 및 가속 기법과 호환 가능한 일반적인 방법을 설계하기 위해.
제안 방법
- QueryDet는 저해상도 특징 맵에서 거친 객체 위치를 예측하기 위해 계단식 희소 쿼리(CSQ) 메커니즘을 사용한다.
- 예측된 위치는 고해상도 특징에 대해 희소 계산을 유도하는 쿼리로 기능하며, 전체 컨볼루션 처리를 피한다.
- 희소 컨볼루션은 검출 헤드에 적용되어 각 쿼리 위치 주변의 컨텍스트 패치(예: 5×5) 내 특징만 처리한다.
- 쿼리 헤드는 희소 영역에서의 정렬 신뢰도 향상을 위해 포칼 손실로 훈련된다.
- 이 방법은 하나의 단계(예: RetinaNet, FCOS) 및 두 단계(예: Faster R-CNN) 검출기 모두와 호환된다.
- 이 방법은 모듈식이며 경량 백본, 정량화 및 지식 정복과도 조합 가능하다.
실험 결과
연구 질문
- RQ1쿼리 기반 메커니즘이 소형 객체 검출 정확도를 훼손하지 않고 고해상도 특징 맵의 계산량을 줄일 수 있는가?
- RQ2가속화를 가능하게 하면서도 높은 검출 AP를 유지하기 위해 필요한 컨텍스트(예: 패치 크기)는 어느 정도인가?
- RQ3제안된 CSQ 메커니즘이 앵커 기반 및 두 단계 검출기와 같은 다양한 검출기 아키텍처로 일반화될 수 있는가?
- RQ4VisDrone와 같이 소형 객체 밀도가 높은 데이터셋에서 이 방법의 성능은 어떠한가?
- RQ5이 방법은 경량 백본과 같은 다른 가속 기법과 얼마나 잘 조합될 수 있는가?
주요 결과
- COCO에서 QueryDet는 고해상도 특징을 사용할 때 mAP를 1.0 향상시키고 mAP-small을 2.0 향상시키며, 고해상도 인fer에서 평균 3.0배의 속도 향상을 달성한다.
- VisDrone에서 QueryDet는 새로운 최고 기록인 mAP-small 성능을 기록했으며, 고해상도 검출에서 평균 2.3배의 가속도를 달성한다.
- MobileNet V2를 사용할 경우, QueryDet는 고해상도 검출에서 평균 4.1배의 속도 향상을 달성하여 엣지 배포 잠재력이 뛰어나다는 것을 입증한다.
- 최신 기술 수준의 앵커 기반 비검출기인 FCOS에 적용했을 때, QueryDet는 mAP-small을 향상시키며 고해상도 인fer에서 1.8배의 속도 향상을 달성한다.
- Faster R-CNN에서 CSQ는 인fer 속도를 17.57에서 19.03 FPS로 향상시켰으며, mAP-small은 22.98에서 22.98로 거의 변화 없이 유지되어 두 단계 검출기에서의 효과를 확인한다.
- 시각화 결과 쿼리 히트맵이 소형 객체를 성공적으로 국소화하는 것으로 나타났지만, 실패 사례로는 큰 객체에서 잘못된 양성 결과와 부족한 컨텍스트로 인한 누락 검출이 포함된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.