Skip to main content
QUICK REVIEW

[논문 리뷰] DenseCLIP: Language-Guided Dense Prediction with Context-Aware Prompting

Yongming Rao, Wenliang Zhao|arXiv (Cornell University)|2021. 12. 02.
Multimodal Machine Learning Applications참고 문헌 51인용 수 37
한 줄 요약

DenseCLIP은 이미지-텍스트 매칭을 픽셀-텍스트 매칭으로 변환하고 학습 중 언어 임베딩을 정제하기 위해 문맥 인식 프롬프트를 적용하여 비전-언어 사전 학습(CLIP)에서 밀집 예측으로 지식을 전달한다.

ABSTRACT

Recent progress has shown that large-scale pre-training using contrastive image-text pairs can be a promising alternative for high-quality visual representation learning from natural language supervision. Benefiting from a broader source of supervision, this new paradigm exhibits impressive transferability to downstream classification tasks and datasets. However, the problem of transferring the knowledge learned from image-text pairs to more complex dense prediction tasks has barely been visited. In this work, we present a new framework for dense prediction by implicitly and explicitly leveraging the pre-trained knowledge from CLIP. Specifically, we convert the original image-text matching problem in CLIP to a pixel-text matching problem and use the pixel-text score maps to guide the learning of dense prediction models. By further using the contextual information from the image to prompt the language model, we are able to facilitate our model to better exploit the pre-trained knowledge. Our method is model-agnostic, which can be applied to arbitrary dense prediction systems and various pre-trained visual backbones including both CLIP models and ImageNet pre-trained models. Extensive experiments demonstrate the superior performance of our methods on semantic segmentation, object detection, and instance segmentation tasks. Code is available at https://github.com/raoyongming/DenseCLIP

연구 동기 및 목표

  • 이미지-텍스트 사전 학습(CLIP)와 밀집 예측 태스크(픽셀 단위 출력) 사이의 간격을 좁히기.
  • 픽셀-텍스트 매칭을 활용해 밀집 예측기를 유도하고 이미지 맥락을 사용해 언어 모델에 프롬프트를 적용.
  • 다양한 백본 및 밀집 예측 프레임워크에 대한 모델-아그노스틱 적용 가능성 시연.
  • ImageNet- pretrained 베이스라인 및 일반 CLIP 미세조정 대비 시맨틱 세분화, 물체 탐지 및 인스턴스 세분화의 개선을 보임.

제안 방법

  • CLIP의 이미지-텍스트 매칭을 CLIP 이미지 인코더로부터 얻은 언어에 호환되는 피처 맵과 K 클래스에 대한 텍스트 임베딩 세트를 사용해 픽셀-텍스트 매칭으로 변환한다.
  • 피처 z를 정규화하고 텍스트 특징 t와 곱해 픽셀-텍스트 점수 맵 s를 계산: s = z_hat t_hat^T.
  • 점수 맵을 보조 분할 손실로 사용하고 이미지 피처와 결합해 밀집 예측기를 안내한다: x_4' = [x_4, s].
  • 문맥 인식 프롬프트 탐색: (a) 시각 맥락을 사용해 프롬프트를 미리 형성하는 프리-모델 프롬 prompting, (b) 텍스트 인코더 이후 Transformer 디코더를 통한 텍스트 피처를 다듬는 포스트-모델 프롬 prompting; 효율성과 성능 측면에서 기본값으로 포스트-모델 프롬 prompting을 선택.
  • 보조 손실: (i) 분할 작업을 위한 픽셀-텍스트 점수 맵의 분할 손실, (ii) 탐지/인스턴스 세분화용 픽셀-텍스트 맵의 이진 교차 엔트로피 손실.
  • CLIP 이미지 인코더 외의 백본(예: ImageNet 사전 학습 ResNet, Swin)과의 호환성 보여주기: CLIP 텍스트 인코더를 동결하고 언어 priors로 백본을 안내.

실험 결과

연구 질문

  • RQ1CLIP 기반의 언어 priors가 분류를 넘어 밀집 예측 태스크를 개선할 수 있는가?
  • RQ2픽셀-텍스트 정렬을 활용해 밀집 예측 모델을 효과적으로 안내할 수 있는가?
  • RQ3문맥 인식 프롬프트 전략이 비전-언어 지식을 밀집 태스크로의 전달을 개선하는가?
  • RQ4DenseCLIP은 백본에 대해 비-CLIP 이미지 인코더에서도 이득이 있는가?
  • RQ5DenseCLIP를 적용했을 때 시맨틱 세분화, 물체 탐지 및 인스턴스 세분화에서 실증적 이점은 무엇인가?

주요 결과

  • DenseCLIP은 ADE20K에서 시맨틱 세분화를 향상시키며, 백본(예: ResNet-50, ResNet-101, ViT-B) 전반에서 ImageNet 사전 학습 대비 더 높은 mIoU를 달성한다.
  • DenseCLIP은 ADE20K에서 Semantic FPN과 함께 일반 CLIP 미세조정에 비해 현저한 이득을 준다(예: ResNet-50: 43.5 vs 39.6 mIoU SS).
  • COCO에서 DenseCLIP은 ImageNet 사전 학습 및 일반 CLIP 미세조정보다 물체 탐지와 인스턴스 세분화를 일관되게 향상시키며 RetinaNet과 Mask R-CNN에서 AP 및 마스크 AP의 이득을 보인다(예: RN50-DenseCLIP vs RN50-CLIP의 AP).
  • 포스트-모델 프롬 prompting(텍스트 인코더 이후의 언어 정제)이 프리-모델 프롬 prompting보다 더 나은 성능과 더 적은 추가 FLOPs를 제공한다.
  • DenseCLIP는 DenseCLIP 지침과 함께 비-CLIP 백본(ResNet, Swin)에서도 개선 효과를 볼 수 있어 이 프레임워크의 일반성을 보여준다.
  • 단일 ResNet-101에 DenseCLIP과 경량 디코더를 결합하면 일부 최신 방법과 비교해 계산을 감소시키면서도 ADE20K 성능이 경쟁력 있게 나타난다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.