Skip to main content
QUICK REVIEW

[논문 리뷰] GridCLIP: One-Stage Object Detection by Grid-Level CLIP Representation Learning

Jiayi Lin, Shaogang Gong|arXiv (Cornell University)|2023. 03. 16.
Multimodal Machine Learning Applications인용 수 6
한 줄 요약

GridCLIP는 장기적 테일 및 오픈_vocabular 데이터셋에서의 검출 성능 향상을 위해 CLIP의 시각-언어 사전학습을 활용하는 일단계 객체 검출기이다. 이는 이미지 수준과 격자 수준의 정렬을 도입하여 CLIP의 통합적인 이미지-텍스트 표현을 세분화된 격자 수준의 특징으로 적응시키고, 이미지 수준 표현으로부터 일반화 가능한 지식을 흡수함으로써, ViLD와 같은 이단계 검출기 수준의 성능을 달성하면서도 훈련 시 43배 빠르고 추론 시 5배 빠르다.

ABSTRACT

A vision-language foundation model pretrained on very large-scale image-text paired data has the potential to provide generalizable knowledge representation for downstream visual recognition and detection tasks, especially on supplementing the undersampled categories in downstream model training. Recent studies utilizing CLIP for object detection have shown that a two-stage detector design typically outperforms a one-stage detector, while requiring more expensive training resources and longer inference time. In this work, we propose a one-stage detector GridCLIP that narrows its performance gap to those of two-stage detectors, with approximately 43 and 5 times faster than its two-stage counterpart (ViLD) in the training and test process respectively. GridCLIP learns grid-level representations to adapt to the intrinsic principle of one-stage detection learning by expanding the conventional CLIP image-text holistic mapping to a more fine-grained, grid-text alignment. This differs from the region-text mapping in two-stage detectors that apply CLIP directly by treating regions as images. Specifically, GridCLIP performs Grid-level Alignment to adapt the CLIP image-level representations to grid-level representations by aligning to CLIP category representations to learn the annotated (especially frequent) categories. To learn generalizable visual representations of broader categories, especially undersampled ones, we perform Image-level Alignment during training to propagate broad pre-learned categories in the CLIP image encoder from the image-level to the grid-level representations. Experiments show that the learned CLIP-based grid-level representations boost the performance of undersampled (infrequent and novel) categories, reaching comparable detection performance on the LVIS benchmark.

연구 동기 및 목표

  • CLIP 기반 표현을 사용한 객체 검출에서 일단계 및 이단계 검출기 간 성능 격차를 해소하기 위해.
  • 추가적인 이미지-캡션 또는 레이블 데이터 없이 장기적 테일 데이터셋에서 부족하게 샘플링된(희귀 및 신규) 카테고리의 검출을 향상시키기 위해.
  • CLIP의 통합적인 이미지-텍스트 매핑을 국소화된 격자 수준 표현으로 적응시켜 효율적이고 고속의 일단계 검출을 가능하게 하기 위해.
  • 이미지 수준 표현에서 격자 수준 특징으로의 지식 정복을 탐색하여 더 넓은 카테고리 일반화를 달성하기 위해.

제안 방법

  • GridCLIP는 CLIP의 이미지 수준 임베딩을 격자 수준 특징으로 매핑하기 위해 격자 수준 정렬을 도입하여 기초 카테고리의 CLIP 텍스트 임베딩과 정렬한다.
  • 훈련 중에 이미지 수준 정렬을 적용하여 CLIP의 이미지 수준 표현으로부터 일반화 가능한 지식을 격자 수준 특징으로 전달함으로써 기초 및 신규 카테고리 모두의 성능 향상을 도모한다.
  • 검출 전용 데이터에 대한 추가 미세조정 없이 CLIP의 사전 학습된 시각 및 텍스트 인코더를 사용하여 고차원의 시각적 및 텍스트 임베딩을 생성한다.
  • CLIP 이미지 인코더의 통합 표현에서 검출기의 격자 수준 특징으로 지식 정복을 수행함으로써 오픈셋 검출 능력을 가능하게 한다.
  • 모델은 CLIP 최적화된 시각 인코더(예: ViT-B/32 또는 RN50×64)를 활용하여 격자 수준 및 이미지 수준에서 텍스트 임베딩과 정렬된 특징 맵을 추출한다.
  • 검출기는 격자 수준 특징을 입력으로 사용하는 표준 일단계 헤드 아키텍처(예: RetinaNet 스타일)를 사용하여 바운딩 박스 및 카테고리 예측을 수행한다.

실험 결과

연구 질문

  • RQ1CLIP의 통합적인 이미지-텍스트 매핑을 국소화된 특징에 적응시키기 위해 일단계 검출기에서 격자 수준 정렬을 도입하면 희귀 카테고리의 검출 성능 향상에 기여하는가?
  • RQ2추가적인 미세조정 데이터 없이 이미지 수준 정렬이 오픈셋 검출에서 신규(미사용된) 카테고리로의 일반화를 향상시키는가?
  • RQ3격자 수준 및 이미지 수준 정렬의 조합은 LVIS v1.0과 같은 장기적 테일 데이터셋에서 성능에 어떤 영향을 미치는가?
  • RQ4CLIP의 이미지 수준 표현이 동시에 여러 개의 객체 카테고리를 얼마나 잘 포괄하는가, 그리고 이는 검출에 어떻게 기여하는가?

주요 결과

  • GridCLIP는 훈련 시 43배 빠르고 추론 시 5배 빠르지만, LVIS v1.0에서 ViLD와 같은 이단계 검출기 수준의 검출 성능을 달성한다.
  • 이미지 수준 정렬은 신규 카테고리의 mAP를 2.6점 향상시켰으며, 기초 카테고리 성능은 유지했다.
  • 격자 수준 정렬은 가장 희귀한 100개 카테고리에서 성능을 크게 향상시켜, 기준 모델보다 닫힌 집합 검출에서 뛰어난 성능을 보였다.
  • ViT-B/32 및 RN50×64 CLIP 인코더는 각각 이미지 내 카테고리의 75%와 60%를 300개 이내로 검색하는 데 성공(Recall@300), 강력한 다중 카테고리 표현 능력을 보였다.
  • 두 정렬의 조합은 희귀 및 신규 카테고리의 효과적인 검출을 가능하게 하여 장기적 테일 분포 문제를 완화시켰다.
  • 이미지 수준 표현에서의 효과적인 지식 정복 덕분에 GridCLIP는 존재하는 일단계 CLIP 기반 검출기보다 오픈셋 검출에서 특히 가장 희귀한 카테고리에서 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.