[논문 리뷰] Learning to Prompt for Open-Vocabulary Object Detection with Vision-Language Model
이 논문은 시각-언어 모델을 사용하여 개방형 어휘 객체 검출을 위한 연속 프롬프트 표현을 자동으로 학습하는 방법인 Detection Prompt (DetPro)를 제안한다. 기존의 이미지 분류에 집중한 방법들과는 달리, DetPro는 부정적 제안(음성)에 대한 최적화를 위해 배경 해석 기법을 도입하고, 긍정적 제안에 대해 맥락 수준에 맞게 프롬프트 학습을 조정하기 위한 맥락 평가 기법을 제안한다. 이를 통해 기준 모델인 ViLD 대비 LVIS에서 새로운 클래스에 대해 각각 +3.4 AP¹¹ 및 +3.0 AP¹¹의 성능 향상을 달성한다.
Recently, vision-language pre-training shows great potential in open-vocabulary object detection, where detectors trained on base classes are devised for detecting new classes. The class text embedding is firstly generated by feeding prompts to the text encoder of a pre-trained vision-language model. It is then used as the region classifier to supervise the training of a detector. The key element that leads to the success of this model is the proper prompt, which requires careful words tuning and ingenious design. To avoid laborious prompt engineering, there are some prompt representation learning methods being proposed for the image classification task, which however can only be sub-optimal solutions when applied to the detection task. In this paper, we introduce a novel method, detection prompt (DetPro), to learn continuous prompt representations for open-vocabulary object detection based on the pre-trained vision-language model. Different from the previous classification-oriented methods, DetPro has two highlights: 1) a background interpretation scheme to include the proposals in image background into the prompt training; 2) a context grading scheme to separate proposals in image foreground for tailored prompt training. We assemble DetPro with ViLD, a recent state-of-the-art open-world object detector, and conduct experiments on the LVIS as well as transfer learning on the Pascal VOC, COCO, Objects365 datasets. Experimental results show that our DetPro outperforms the baseline ViLD in all settings, e.g., +3.4 APbox and +3.0 APmask improvements on the novel classes of LVIS. Code and models are available at https://github.com/dyabel/detpro.
연구 동기 및 목표
- 수동적 프롬프트 엔지니어링이 시간이 오래 걸리고 도메인 전문 지식이 필요하기 때문에, 개방형 어휘 객체 검출에서의 이러한 과제를 해결하기 위해.
- 새로운 객체 클래스에 잘 일반화되는 연속 프롬프트 표현을 자동으로 학습하기 위해.
- 프롬프트 학습 중에 부정(배경) 제안과 긍정 제안의 다양한 맥락 수준을 통합함으로써 검출 성능을 향상시키기 위해.
- 이미지 분류에 국한되어 있던 프롬프트 표현 학습을 더 복잡한 객체 검출 설정으로 확장하기 위해, 배경과 전경을 구분할 수 있도록.
- 학습된 프롬프트 표현이 검출 및 제로샷 분류 작업 모두에서 수작업으로 만든 프롬프트를 능가할 수 있음을 입증하기 위해.
제안 방법
- DetPro는 부정적 제안이 모든 클래스 임베딩에서 멀리 떨어지도록 명시적으로 최적화하는 배경 해석 기법을 도입하여 배경 구분 능력을 향상시킨다.
- 긍정적 제안을 다양한 맥락 수준으로 분할하고 각 수준에 맞는 맞춤형 프롬프트 학습을 적용함으로써 맥락 복잡도의 다양성을 다루는 맥락 평가 기법을 활용한다.
- 온도가 0.01인 대비적 크로스엔트로피 손실을 사용하여 이미지 제안 임베딩과 해당 클래스 임베딩 간의 유사도를 최적화함으로써 연속 프롬프트 임베딩을 훈련한다.
- DetPro는 ViLD, 즉 최신 개방형 검출기와 통합되며, 훈련 및 추론 중에 프롬프트 기반 텍스트 인코더를 학습된 연속 프롬프트로 교체한다.
- 훈련 과정은 다중 척도 데이터 증강을 사용하고 배치 크기는 512이며, RPN은 이미지당 최대 1000개의 제안을 생성한다.
- 추론 시에는 학습된 프롬프트 임베딩을 사용하여 분류기 역할을 하는 클래스 임베딩을 생성하고, 이를 검출기 헤드의 객체 제안에 적용한다.
실험 결과
연구 질문
- RQ1이미지 분류에서 유도된 연속 프롬프트 학습이 더 복잡한 객체 검출 작업으로 효과적으로 적용될 수 있는가?
- RQ2프롬프트 훈련에 부정(배경) 제안을 포함시키는 것이 개방형 설정에서 검출 성능에 어떤 영향을 미치는가?
- RQ3긍정 제안의 맥락 수준에 따라 프롬프트 학습을 맞춤화하면 새로운 클래스에 대한 일반화 능력이 향상되는가?
- RQ4학습된 프롬프트 표현이 검출 및 제로샷 이미지 분류 양쪽 작업에서 수작업 프롬프트를 능가할 수 있는가?
- RQ5프롬프트 훈련 중에 사용하는 긍정 샘플의 수를 변화시켰을 때 모델의 일반화 능력에 어떤 영향을 미치는가?
주요 결과
- DetPro는 기준 모델인 ViLD 대비 LVIS 벤치마크에서 새로운 클래스에 대해 각각 +3.4 AP¹¹ 및 +3.0 AP¹¹의 성능 향상을 달성한다.
- DetPro 훈련 시 모든 긍정 샘플을 사용할 경우 가장 우수한 일반화 성능를 보이며, 새로운 클래스에서 AP¹¹가 25.4에 도달한다.
- DetPro는 새로운 클래스의 최상위 1위 및 최상위 5위 제안 분류 정확도를 각각 21.7%와 40.3%로 향상시켰으며, 이는 수작업 프롬프트 엔지니어링 대비 17.7%와 37.2%보다 높다.
- 최적 설정에서 사전 학습된 ViLD와 DetPro를 앙상블하여 통합하면 추가적인 성능 향상이 이루어지며, AP¹¹가 25.4로 상승한다.
- t-SNE 시각화 결과 DetPro가 생성한 클래스 임베딩은 Pascal VOC, COCO, Objects365 전반에서 프롬프트 엔지니어링에 비해 임베딩 공간에서 더 구분력이 높다는 것을 확인한다.
- 절단 분석 결과 맥락 평가 기법과 배경 해석 기법이 모두 필수적임을 입증하였으며, 이들의 결여는 성능 저하로 이어진다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.