[논문 리뷰] Detecting Twenty-thousand Classes using Image-level Supervision
Detic는 이미지 수준의 레이블만을 사용하여 최대 21,000개의 클래스에 대해 객체 검출기를 훈련시키는 단순하면서도 효과적인 방법을 제안한다. 이는 분류를 국소화에서 분리하고, 각 이미지의 가장 큰 제안 영역에만 이미지 수준의 감독을 적용함으로써 이루어진다. 이 방법은 개방형 어휘 및 장꼬리 감지 벤치마크에서 최신 기술 수준의 성능을 달성하며, LVIS에서 신규 클래스에 대해 mAP를 8.3 포인트 향상시켜 희귀 클래스와 일반 클래스 간의 성능 격차를 해소한다.
Current object detectors are limited in vocabulary size due to the small scale of detection datasets. Image classifiers, on the other hand, reason about much larger vocabularies, as their datasets are larger and easier to collect. We propose Detic, which simply trains the classifiers of a detector on image classification data and thus expands the vocabulary of detectors to tens of thousands of concepts. Unlike prior work, Detic does not need complex assignment schemes to assign image labels to boxes based on model predictions, making it much easier to implement and compatible with a range of detection architectures and backbones. Our results show that Detic yields excellent detectors even for classes without box annotations. It outperforms prior work on both open-vocabulary and long-tail detection benchmarks. Detic provides a gain of 2.4 mAP for all classes and 8.3 mAP for novel classes on the open-vocabulary LVIS benchmark. On the standard LVIS benchmark, Detic obtains 41.7 mAP when evaluated on all classes, or only rare classes, hence closing the gap in performance for object categories with few samples. For the first time, we train a detector with all the twenty-one-thousand classes of the ImageNet dataset and show that it generalizes to new datasets without finetuning. Code is available at \url{https://github.com/facebookresearch/Detic}.
연구 동기 및 목표
- 희귀 또는 장꼬리 클래스에 대해 바운딩 박스 애너테이션이 부족하여 객체 검출에서 어휘 크기가 제한되는 문제를 해결하기 위해.
- 각 클래스에 대해 바운딩 박스 애너테이션을 요구하지 않고도 수만 개의 클래스로 일반화할 수 있는 검출 모델을 가능하게 하기 위해.
- 예측 기반의 레이블 할당 방식을 피하기 위해 분류를 국소화에서 분리함으로써 약한 감독 검출을 단순화하기 위해.
- 대규모 이미지 분류 데이터를 활용하여 희귀 및 신규 클래스의 성능을 향상시키기 위해.
제안 방법
- Detic는 기본 클래스에 대해 표준 바운딩 박스 수준의 애너테이션을 사용하고, 모든 클래스에 대해 ImageNet-21K와 같은 대규모 데이터셋의 이미지 수준 레이블을 사용하여 검출기를 훈련시킨다.
- 이 방법은 각 이미지의 가장 큰 제안 영역에만 분류 손실을 적용하여 복잡한 레이블-박스 할당 체계가 필요로 하지 않는다.
- 국소화(박스 감독을 통해 훈련)와 분류(이미지 수준 감독을 통해 훈련)를 분리함으로써 확장 가능한 어휘 크기 확장을 가능하게 한다.
- 검출기 및 분류기 헤드 간에 공유 백본과 헤드를 사용하며, 분류기 헤드는 이미지 분류 데이터에서 사전 훈련된 것을 사용한다.
- 이 방법은 다양한 검출 아키텍처(예: Mask R-CNN, DETR)와 백본(예: Swin-B, ResNeXt)과 호환된다.
- 이미지 수준 데이터와의 공동 훈련은 사전 훈련 기술 향상과 독립적인 방식으로 특징 및 분류기 학습을 향상시킨다.
실험 결과
연구 질문
- RQ1ImageNet-21K와 같은 대규모 데이터셋의 이미지 수준 감독이 바운딩 박스 애너테이션이 없는 상황에서 희귀 및 신규 클래스의 검출 성능을 크게 향상시킬 수 있는가?
- RQ2예측 기반이 아닌 단순한 레이블 할당 전략(예: 모든 이미지 레이블을 가장 큰 제안 영역에 할당)이 약한 감독 검출에서 복잡한 할당 체계를 능가하는가?
- RQ321,000개 클래스로 훈련된 검출기가 레이블 공간이 완전히 다른 새로운 데이터셋에 대해 미세조정 없이 일반화할 수 있는가?
- RQ4Detic의 성능는 개방형 어휘 및 표준 LVIS 벤치마크에서 완전히 감독된 기준 모델과 이전의 약한 감독 방법과 비교해 어떻게 되는가?
주요 결과
- Detic는 표준 LVIS 벤치마크에서 41.7 mAP와 41.7 mAP<sub>rare</sub>를 기록하여 희귀 클래스와 일반 클래스 간의 성능 격차를 해소했다.
- 개방형 어휘 LVIS 벤치마크에서, Detic는 강력한 박스 감독 기반 모델 대비 모든 클래스에서 mAP를 2.4 포인트 향상시키고, 신규 클래스에서는 8.3 포인트 향상시켰다.
- ImageNet-21K의 이미지 수준 감독을 사용할 경우, Detic는 전체 애너테이션 훈련의 성능 상한선에 도달하여, 신규 클래스에서 24.9 mAP<sub>novel</sub>의 성능을 달성했다.
- Detic는 미세조정 없이도 새로운 데이터셋으로 일반화할 수 있었으며, Objects365에서 21.5 mAP, OpenImages에서 55.2 mAP<sub>50</sub>의 성능을 기록했다.
- 이 방법은 다양한 백본과 분류기(예: CLIP, FastText, 무작위 초기화 분류기)에서 뚜렷한 성능 향상을 보이며 안정적인 성능을 유지한다.
- 이미지 수준 데이터와의 공동 훈련은 사전 훈련 데이터에 관계없이 일관된 성능 향상을 제공하며, 사전 훈련 기술 향상과 독립적인 성과를 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.