[논문 리뷰] Multi-modal Queried Object Detection in the Wild
MQ-Det는 가시성 예시와 텍스트 쿼리를 게이트형 클래스 스케일러블 퍼서버 모듈을 통해 융합함으로써 언어 기반 쿼리 검출기를 향상시키는 플러그 앤 플레이이며 효율적인 다중 모odal 쿼리 기반 객체 검출 프레임워크를 제안한다. 시각 조건부 마스킹된 언어 예측을 도입함으로써, 미세조정 없이도 GLIP의 사전학습 시간의 3%만을 사용하여 LVIS에서 +7.8% AP, 13개의 소수 샘플 작업에서 평균 +6.3% AP를 달성한다.
We introduce MQ-Det, an efficient architecture and pre-training strategy design to utilize both textual description with open-set generalization and visual exemplars with rich description granularity as category queries, namely, Multi-modal Queried object Detection, for real-world detection with both open-vocabulary categories and various granularity. MQ-Det incorporates vision queries into existing well-established language-queried-only detectors. A plug-and-play gated class-scalable perceiver module upon the frozen detector is proposed to augment category text with class-wise visual information. To address the learning inertia problem brought by the frozen detector, a vision conditioned masked language prediction strategy is proposed. MQ-Det's simple yet effective architecture and training strategy design is compatible with most language-queried object detectors, thus yielding versatile applications. Experimental results demonstrate that multi-modal queries largely boost open-world detection. For instance, MQ-Det significantly improves the state-of-the-art open-set detector GLIP by +7.8% AP on the LVIS benchmark via multi-modal queries without any downstream finetuning, and averagely +6.3% AP on 13 few-shot downstream tasks, with merely additional 3% modulating time required by GLIP. Code is available at https://github.com/YifanXu74/MQ-Det.
연구 동기 및 목표
- 오픈 범주 객체 검출에서 텍스트만으로 쿼리하는 데서 기인하는 기술적 세부 정보의 제한을 해결하기 위해.
- 재학습이나 치명적인 기억 상실 없이도 시각 예시를 사용하여 세밀한 인식을 가능하게 하기 위해.
- 고정된 기초 검출기의 일반화 능력을 유지하면서도, 플러그 앤 플레이이며 효율적인 조절 전략을 개발하기 위해.
- 통합된 텍스트 및 이미지 쿼리로 강력한 소수 샘플 및 제로 샘플 검출 성능을 달성하기 위해.
- 고정된 기초 검출기의 조절 과정에서 학습 관성 문제를 극복하기 위해 시각 조건부 마스킹된 언어 예측을 도입하기 위해.
제안 방법
- 텍스트 인코더의 각 고수준 단계에서 시각적 힌트를 텍스트 임베딩에 주입하기 위해 클래스별 크로스 어텐션을 적용하는 게이트형 클래스 스케일러블 퍼서버(GCP) 모듈을 도입한다.
- 시각적 쿼리 품질에 따라 융합을 조절하는 조건부 게이팅 메커니즘을 사용하여, 시각적 세부 정보의 적응적 통합을 가능하게 한다.
- 초기 일반화 능력을 유지하면서도 텍스트 임베딩 공간에서의 변형을 允허하기 위해 잔차 유사 잔차 연결을 적용한다.
- 조절 과정 중에 시각 조건부 마스킹된 언어 예측 전략을 사용한다: 랜덤으로 텍스트 토큰을 마스킹하고, 시각 쿼리가 독립적으로 객체 클래스를 예측하도록 유도한다.
- 기존 검출 백본을 고정하고 GCP 모듈만 미세조정함으로써, 최소한의 계산 비용을 확보하고 치명적인 기억 상실을 방지한다.
- Objects365 데이터셋에서 클래스당 5개의 시각 예시와 해당 텍스트 설명을 사용하여 학습함으로써, 강력한 제로 샘플 일반화 성능을 달성한다.
실험 결과
연구 질문
- RQ1텍스트 + 시각 예시의 다중 모달 쿼리가 텍스트만으로 쿼리하는 것보다 오픈 범주 객체 검출 성능을 크게 향상시킬 수 있는가?
- RQ2치명적인 기억 상실이나 광범위한 재학습 없이도 시각 예시를 텍스트 쿼리와 효과적으로 융합할 수 있는가?
- RQ3고정된 기초 검출기를 시각 쿼리로 조절할 때 학습 관성 문제를 극복할 수 있는 학습 전략은 무엇인가?
- RQ4플러그 앤 플레이 모듈이 다양한 언어 기반 쿼리 검출기의 계산 오버헤드를 최소화하면서 성능을 향상시킬 수 있는가?
- RQ5통합된 텍스트 및 이미지 쿼리가 소수 샘플 및 오픈 세트 벤치마크에서 성능 향상에 얼마나 기여하는가?
주요 결과
- MQ-Det는 GLIP 검출기의 사전학습 시간의 3%만을 사용하여, 어떤 후행 미세조정 없이도 LVIS 벤치마크에서 +7.8% AP 향상을 달성한다.
- 13개의 소수 샘플 검출 작업에서 MQ-Det는 GLIP 대비 평균 +6.3% AP 향상을 기록하여 강력한 소수 샘플 일반화 능력을 입증한다.
- 시각 조건부 마스킹된 언어 예측 전략은 학습 관성 문제를 효과적으로 해결하여, 조절 과정 중에 더 깊은 시각 지식 통합을 가능하게 한다.
- GCP 모듈은 클래스별 전용 파라미터를 도입하지 않으며, 어떤 언어 기반 쿼리 검출기와도 호환되어 광범위한 적용 가능성을 지닌다.
- 클래스당 5개의 시각 예시만으로도 높은 데이터 효율성을 보이며, 일반화 능력이 유지됨을 보여준다.
- 검출기를 고정하지 않고 미세조정할 경우 LVIS에서 AP가 -6.0% 감소함을 확인하여, 고정된 학습 전략의 중요성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.