Skip to main content
QUICK REVIEW

[논문 리뷰] CoDet: Co-Occurrence Guided Region-Word Alignment for Open-Vocabulary Object Detection

Chuofan Ma, Yi Jiang|arXiv (Cornell University)|2023. 10. 25.
Multimodal Machine Learning Applications인용 수 5
한 줄 요약

CoDet는 사전에 정렬된 시각-언어 모델에 의존하지 않고, 공통 개념을 공유하는 이미지 그룹 간의 시각적 유사성에 기반해 영역-단어 정렬을 공시 발생 객체 탐지로 공식화함으로써 새로운 개방형 어휘 객체 검출 프레임워크를 제안한다. 개념 그룹 내에서 텍스트 유도형 프로토타입 기반 영역 매칭을 활용함으로써 CoDet는 최신 기술 수준의 성능을 달성하여 OV-LVIS에서 각각 37.0 APₘⁿᵒᵛ와 44.7 APₘᵃˡˡ을 기록하며, 이는 이전 최신 기술 수준보다 각각 4.2점과 9.8점 향상된 성능이다.

ABSTRACT

Deriving reliable region-word alignment from image-text pairs is critical to learn object-level vision-language representations for open-vocabulary object detection. Existing methods typically rely on pre-trained or self-trained vision-language models for alignment, which are prone to limitations in localization accuracy or generalization capabilities. In this paper, we propose CoDet, a novel approach that overcomes the reliance on pre-aligned vision-language space by reformulating region-word alignment as a co-occurring object discovery problem. Intuitively, by grouping images that mention a shared concept in their captions, objects corresponding to the shared concept shall exhibit high co-occurrence among the group. CoDet then leverages visual similarities to discover the co-occurring objects and align them with the shared concept. Extensive experiments demonstrate that CoDet has superior performances and compelling scalability in open-vocabulary detection, e.g., by scaling up the visual backbone, CoDet achieves 37.0 $ ext{AP}^m_{novel}$ and 44.7 $ ext{AP}^m_{all}$ on OV-LVIS, surpassing the previous SoTA by 4.2 $ ext{AP}^m_{novel}$ and 9.8 $ ext{AP}^m_{all}$. Code is available at https://github.com/CVMI-Lab/CoDet.

연구 동기 및 목표

  • 기존 개방형 어휘 객체 검출기들이 정확도와 일반화 능력이 떨어지는 사전에 훈련된 시각-언어 모델에 의존하는 한계를 해결하기 위해.
  • 개방형 어휘 검출에서 영역-단어 정렬을 위한 사전에 정렬된 시각-언어 공간에 대한 의존성을 제거하기 위해.
  • 캡션에 동일한 개념을 공유하는 이미지 간의 시각적 공시 발생 패턴을 이용해 신뢰할 수 있는 영역-단어 대응을 발견하기 위해.
  • 텍스트 유도형 유사도 추정과 프로토타입 기반 영역 집합을 도입함으로써 정렬 정확도와 확장성을 향상시키기 위해.
  • 인간이 레이블링한 영역-텍스트 쌍이 필요 없이도 개방형 어휘 검출 벤치마크에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • CoDet는 공통 개념을 포함한 캡션을 가진 이미지를 샘플링하여 의미 그룹을 구성함으로써 공시 발생 탐지의 기초를 마련한다.
  • 그룹 내에서 이미지 간 영역 유사도를 계산하여 공시 발생 객체를 식별함으로써, 공통 개념과 지속적으로 함께 나타나는 영역에 초점을 맞춘다.
  • 노이즈가 있는 유사도 추정에 대비해 강건성을 높이기 위해 소프트 가중치를 사용하여 그룹 내 영역 제안을 기반으로 프로토타입을 구축한다.
  • 텍스트 유도 기반으로 영역 유사도 계산에 통합하여 개념 인식 능력을 향상시켜 관련이 없거나 유사한 외관을 가진 객체와의 구분 능력을 향상시킨다.
  • 결과적으로 생성된 프로토타입-개념 쌍은 사전에 정렬된 VLM이 필요 없이 개방형 어휘 객체 검출기 훈련을 위한 약한 감독 신호로 기능한다.
  • 이 방법은 ResNet50, Swin-B, EVA02-L를 포함한 다양한 백본에서 확장 가능하고 효과적이다.

실험 결과

연구 질문

  • RQ1공통 개념을 공유하는 이미지 그룹 간의 객체 공시 발생 패턴을 활용해 사전에 훈련된 시각-언어 모델에 의존하지 않고도 신뢰할 수 있는 영역-단어 정렬을 발견할 수 있는가?
  • RQ2시각적 유사도와 텍스트 유도 기반 기법을 함께 사용하여 개방형 어휘 검출에서 정렬 정확도를 향상시킬 수 있는가?
  • RQ3노이즈가 있는 유사도 추정 상황에서 프로토타입 기반 영역 집합이 히وري스틱 선택 방식보다 성능이 뛰어나게 작용하는가?
  • RQ4그룹 크기가 공시 발생 개념 탐지에 영향을 미치는가? 특히 인간이 수작업한 캡션을 포함한 데이터셋과 웹 크롤링 데이터셋 간의 영향을 비교해보면?
  • RQ5제안된 방법이 OV-LVIS나 COCO와 같은 개방형 어휘 검출 벤치마크에서 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • CoDet는 OV-LVIS 벤치마크에서 각각 37.0 APₘⁿᵒᵛ와 44.7 APₘᵃˡˡ의 성능을 기록하며, 이는 이전 최신 기술 수준보다 각각 4.2점과 9.8점 향상된 성능이다.
  • EVA02-L 백본을 사용할 경우 CoDet는 OV-LVIS에서 37.0 APₘⁿᵒᵛ를 달성하여 더 큰 시각 백본에서의 강력한 확장성을 입증한다.
  • 히وري스틱 기반 베이스라인 대비 프로토타입 기반 전략이 신규 카테고리 AP를 3.7점 향상시켜 노이즈가 있는 유사도 추정에 대비한 강건성과 다수의 인스턴스 처리 능력을 입증한다.
  • 텍스트 유도 기반 기법은 신규 카테고리 AP₅₀를 26.6에서 30.6으로 상승시켜 의도하지 않은 개념(예: 의자 다리)에 의한 간섭을 크게 줄였다.
  • OV-COCO에서 그룹 크기를 2에서 8로 늘일 경우 성능이 약간 저하되었으며, 이는 인간이 수작업한 캡션의 편향이 공시 발생 탐지에 악영향을 줄 수 있음을 시사한다.
  • CoDet는 COCO와 Objects365 간의 다중 데이터셋 검출에서 강력한 성능 유지를 보이며 일반화 능력을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.