Skip to main content
QUICK REVIEW

[논문 리뷰] Open Vocabulary Object Detection with Proposal Mining and Prediction Equalization

Peixian Chen, Kekai Sheng|arXiv (Cornell University)|2022. 06. 22.
Multimodal Machine Learning Applications인용 수 7
한 줄 요약

이 논문은 온라인 프로포절 마이닝(OPM)을 통해 프로포절 수준의 시각-언어 정렬을 향상시키고, 오프라인 클래스별 조정(OCA)을 통해 베이스-노블 카테고리 예측 편향을 감소시킴으로써 개방형 어휘 객체 검출을 위한 MEDet 프레임워크를 제안한다. MEDet는 MS COCO에서 노블 카테고리 mAP를 29.1%에서 32.6%로 향상시키며, LVIS에서 1.4% 향상된 22.4% 마스크 AP를 달성하여 개선된 시각-언어 지식과 균형 잡힌 신뢰도 校정을 통해 최신 기술 수준의 성능을 입증한다.

ABSTRACT

Open-vocabulary object detection (OVD) aims to scale up vocabulary size to detect objects of novel categories beyond the training vocabulary. Recent work resorts to the rich knowledge in pre-trained vision-language models. However, existing methods are ineffective in proposal-level vision-language alignment. Meanwhile, the models usually suffer from confidence bias toward base categories and perform worse on novel ones. To overcome the challenges, we present MEDet, a novel and effective OVD framework with proposal mining and prediction equalization. First, we design an online proposal mining to refine the inherited vision-semantic knowledge from coarse to fine, allowing for proposal-level detection-oriented feature alignment. Second, based on causal inference theory, we introduce a class-wise backdoor adjustment to reinforce the predictions on novel categories to improve the overall OVD performance. Extensive experiments on COCO and LVIS benchmarks verify the superiority of MEDet over the competing approaches in detecting objects of novel categories, e.g., 32.6% AP50 on COCO and 22.4% mask mAP on LVIS.

연구 동기 및 목표

  • 粗안정된 이미지 수준의 캡션 애너테이션으로 인해 발생하는 개방형 어휘 객체 검출(OVD)에서의 정확한 프로포절 수준의 시각-언어 정렬 부족 문제를 해결한다.
  • 피취닝 중 발생하는 클래스 불균형과 치명적 기억 상실로 인해 베이스 카테고리에 치우친 예측 편향을 극복한다.
  • 비정형 이미지 캡션을 활용해 프로포절 수준에서 시각-언어 지식을 정교화함으로써 노블 카테고리의 검출 성능을 향상시킨다.
  • 학습 가능한 오프라인 校정 메커니즘을 통해 베이스 및 노블 카테고리 간 더 신뢰도 있고 균형 잡힌 신뢰도 예측을 가능하게 한다.
  • 엔드 투 엔드 프로포절 마이닝과 신뢰도 균형 조정을 통합함으로써 COCO 및 LVIS 벤치마크에서 최신 기술 수준의 성능을 달성한다.

제안 방법

  • 이미지 캡션 텍스트를 활용해 세분화된 프로포절 개념을 추출함으로써, 시각-언어 정렬을 향상시키는 3단계, 군집에서 세분화로의, 엔드 투 엔드 프레임워크인 온라인 프로포절 마이닝(OPM)을 제안한다.
  • 이미지 및 텍스트 임베딩 간의 교차 어텐션을 적용하여 텍스트 임베딩의 구분 능력을 향상시키고, 더 정확한 프로포절-개념 쌍을 생성한다.
  • 유사도 엔트로피와 IoU 기반 필터링을 적용하여 노이즈 있는 프로포절을 제거하고 분할된 프로포절을 병합함으로써 정렬 품질을 향상시킨다.
  • 예측 스코어를 재가중하기 위해 카테고리별 편향 벡터를 학습하는 오프라인 클래스별 조정(OCA)을 도입한다.
  • 각 카테고리의 예측된 AP/AR 성능와 실제 성능 간 격리 최소화를 위한 미분 가능한 손실을 최적화하여 편향 벡터 β를 학습한다.
  • 재학습 없이도 다양한 OVD 모델(OVR-CNN, Detic 등) 간에 학습된 편향 벡터 β를 재사용함으로써 이식성과 재현 가능성을 확보한다.

실험 결과

연구 질문

  • RQ1이미지 캡션에서 온라인으로 엔드 투 엔드 프로포절 마이닝이 개방형 어휘 객체 검출에서 프로포절 수준의 시각-언어 정렬을 향상시킬 수 있는가?
  • RQ2프로포절 수준에서 시각-언어 지식을 정교화하면, 특히 노블 카테고리에 대해 더 나은 검출 성능을 이끌 수 있는가?
  • RQ3간단한 오프라인 클래스별 조정 메커니즘이 OVD에서 베이스 및 노블 카테고리 간의 신뢰도 편향을 효과적으로 줄일 수 있는가?
  • RQ4학습된 신뢰도 校정 편향이 동일한 캡션 데이터셋에서 학습된 다양한 OVD 모델 간에 얼마나 잘 이식될 수 있는가?
  • RQ5OPM의 IoU 임계값과 OCA의 γ와 같은 하이퍼파라미터에 대해 제안된 방법의 성능는 얼마나 민감한가?

주요 결과

  • MEDet는 MS COCO에서 노블 카테고리 mAP를 29.1%에서 32.6%로 3.5%p 상승시켜 이전 최신 기술 수준 대비 절대적 향상률 3.5%를 기록한다.
  • LVIS 벤치마크에서 MEDet는 22.4% 마스크 AP를 달성하여 이전 최신 기술 수준 방법 대비 1.4%p 향상되었다.
  • OCA 구성요소는 다양한 OVD 모델에서 노블 및 베이스 카테고리 성능을 모두 향상시키며, 평균적으로 mAP에서 1%p 이상의 향상률을 기록한다.
  • OCA 편향 벡터 β는 이식 가능하다: OVR-CNN과 Detic에 적용했을 때 각각 mAP가 3.0%p와 1.1%p 향상되었으며, 재학습 없이도 성능 향상이 가능했다.
  • 하이퍼파라미터 분석 결과, OCA는 γ에 대해 상대적으로 민감하지 않으며, 넓은 값 범위에서 최적 성능 유지가 가능했다.
  • OPM의 분석 결과, 세 가지 구성요소인 개념 증강, 노이즈 제거, 조각 병합이 모두 성능 향상에 기여하며, 전체 OPM이 COCO에서 47.5% mAP를 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.