Skip to main content
QUICK REVIEW

[논문 리뷰] OmDet: Large-scale vision-language multi-dataset pre-training with multimodal detection network

Tiancheng Zhao, Peng Liu|arXiv (Cornell University)|2022. 09. 10.
Multimodal Machine Learning Applications참고 문헌 57인용 수 8
한 줄 요약

OmDet는 지속적인 다중 데이터세트 비전-언어 사전학습을 통해 최첨단의 제로샷/페이셜샷 일반화 성능을 달성하는 언어 인식 객체 검출 프레임워크를 제안한다. 다중 모odal 검출 네트워크와 언어 조절 특징 융합, 새로운 훈련 전략을 통해 OmDet는 데이터세트 간의 분류 체계 충돌과 배경/전경 일관성 문제를 극복하며, 2000만 장의 이미지에서 유일한 시각적 개념 400만 개를 학습한 35개의 다운스트림 작업에서 SOTA 성능을 달성한다.

ABSTRACT

The advancement of object detection (OD) in open-vocabulary and open-world scenarios is a critical challenge in computer vision. This work introduces OmDet, a novel language-aware object detection architecture, and an innovative training mechanism that harnesses continual learning and multi-dataset vision-language pre-training. Leveraging natural language as a universal knowledge representation, OmDet accumulates a "visual vocabulary" from diverse datasets, unifying the task as a language-conditioned detection framework. Our multimodal detection network (MDN) overcomes the challenges of multi-dataset joint training and generalizes to numerous training datasets without manual label taxonomy merging. We demonstrate superior performance of OmDet over strong baselines in object detection in the wild, open-vocabulary detection, and phrase grounding, achieving state-of-the-art results. Ablation studies reveal the impact of scaling the pre-training visual vocabulary, indicating a promising direction for further expansion to larger datasets. The effectiveness of our deep fusion approach is underscored by its ability to learn jointly from multiple datasets, enhancing performance through knowledge sharing.

연구 동기 및 목표

  • 다양한 비전-언어 데이터세트로부터의 지속적 학습을 가능하게 하여 오픈 뷰포인트 및 페이셜샷 객체 검출 문제를 해결한다.
  • 다른 레이블 세트를 가진 데이터세트 간의 공동 훈련에서 발생하는 분류 체계 충돌 및 전경/배경 불일치 문제를 해결한다.
  • 사용자가 정의한 임의의 객체 카테고리에 동적으로 적응할 수 있는 확장 가능한 언어 조절 검출 프레임워크를 개발한다.
  • 다중 데이터세트 사전학습을 통해 시각적 어휘 크기를 증가시키면 제로샷/페이셜샷 및 파rameter 효율적인 파인튜닝 성능이 향상됨을 입증한다.
  • 다양하고 실제 세계적인 벤치마크인 ODinW에서 35개의 다운스트림 검출 작업을 포함하여 SOTA 성능을 달성한다.

제안 방법

  • 검출을 작업 조건에 따라 달라지는 자유형 자연어 입력 문제로 설정하는 언어 인식 객체 검출 아키텍처인 OmDet를 제안한다.
  • 시각적 및 텍스처적 특징을 다중 단계에서 융합하는 다중 모달 검출 네트워크(MDN)를 도입하여 입력 작업 설명에 기반한 동적 로컬라이제이션 및 분류를 가능하게 한다.
  • 다양한 레이블 세트를 가진 데이터세트를 통합하기 위해 레이블 분류 체계 통합이 필요 없는 새로운 다중 데이터세트 훈련 알고리즘을 설계하여, 서로 다른 레이블 세트를 가진 데이터세트 간의 공동 학습을 가능하게 한다.
  • 2000만 장 이상의 이미지와 400만 개 이상의 유일한 객체 레이블을 포함한 대규모 사전학습 체제를 구현하며, 인간 레이블링 및 허위 레이블링 데이터를 모두 활용한다.
  • 제한된 도메인 데이터가 있는 다운스트림 작업에 파rameter 효율적인 적응을 가능하게 하기 위해 프롬프트 튜닝 및 헤드 전용 파인튜닝을 활용한다.
  • MDN 블록에서 상향식으로 반복적인 정밀화 메커니즘을 적용하여, 제안 박스가 여러 단계를 거쳐 전체 이미지 영역에서 특정 객체 영역으로 초점을 좁히는 방식으로 진화하도록 한다.

실험 결과

연구 질문

  • RQ1수동적인 레이블 분류 체계 정렬 없이도 다양한 객체 검출 데이터세트의 지속적 스트림에서 효과적으로 학습할 수 있는가?
  • RQ2다중 데이터세트 공동 사전학습은 객체 검출에서 제로샷 및 페이셜샷 일반화 성능에 어떤 영향을 미치는가?
  • RQ3다중 데이터세트 학습을 통해 시각적 개념 어휘 크기를 증가시키면, 파rameter 효율적인 파인튜닝(예: 프롬프트 튜닝) 성능 향상에 어느 정도 기여하는가?
  • RQ4제안된 언어 인식 검출 프레임워크는 기존의 비전-언어 사전학습 방법보다 오픈 뷰포인트 검출 벤치마크에서 우월한 성능을 보이는가?
  • RQ5모델의 동적이고 작업 조건에 따른 행동은 시각적 주의 분포와 경계 상자 정밀화 과정에서 어떻게 나타나는가?

주요 결과

  • OmDet는 더 작은 코퍼스에서 사전학습되었음에도 불구하고 GLIP을 능가하는 SOTA 성능을 달성하며, 제로샷 평가에서 평균 정밀도가 1.1점 높다.
  • 소수의 학습 이미지(≤200장)를 가진 페이셜샷 검출 작업에서 OmDet는 기본 모델인 OmDet-C 대비 AP를 6.41점 절대적으로 향상시켜 강력한 페이셜샷 일반화 능력을 입증한다.
  • GCC 데이터세트를 사전학습에 포함시킬 경우 제로샷 성능이 9.8에서 16.0 AP로 상승함으로써 다양한 대규모 언어-시각 데이터의 중요성을 확인한다.
  • OmDet 사전학습을 사용할 경우 파rameter 효율적인 파인튜닝(예: 프롬프트 튜닝)에서 성능 저하가 65.9%에서 45.5%로 상대적으로 감소함을 확인하여, 자원이 제한된 환경에서의 적응에 효과적임을 입증한다.
  • 시각화 결과는 OmDet가 상향식으로 작업 인식 방식으로 객체 제안을 동적으로 정밀화하며, 2~3단계 내로 전체 이미지 영역에서 관심 있는 특정 객체 영역으로 초점을 좁히는 것을 확인한다.
  • AP 곡선은 사전학습 어휘 크기가 증가함에 따라 일관되게 상승하는 경향을 보이며, 이는 더 넓은 시각적 개념 커버리지가 더 강력한 일반화 및 특징 학습 능력을 유도함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.