Skip to main content
QUICK REVIEW

[논문 리뷰] General Object Foundation Model for Images and Videos at Scale

Junfeng Wu, Yi Jiang|arXiv (Cornell University)|2023. 12. 14.
Multimodal Machine Learning Applications인용 수 5
한 줄 요약

이 논문은 이미지 및 영상에서 감지, 분할, 추적, 기준 지정, 식별을 통합하는 일반적인 객체 기반 모델인 GLEE를 소개한다. 이 모델은 이미지 인코더, 텍스트 인코더, 시각적 프롬프트 기반의 공통 다중모달 프레임워크를 사용한다. 500만 건이 넘는 다양한 약한 지도 학습 데이터로 훈련된 GLEE는 태스크별 적응 없이도 15개 이상의 객체 중심 작업에서 최신 기술 수준의 zero-shot 일반화 성능을 달성한다.

ABSTRACT

We present GLEE in this work, an object-level foundation model for locating and identifying objects in images and videos. Through a unified framework, GLEE accomplishes detection, segmentation, tracking, grounding, and identification of arbitrary objects in the open world scenario for various object perception tasks. Adopting a cohesive learning strategy, GLEE acquires knowledge from diverse data sources with varying supervision levels to formulate general object representations, excelling in zero-shot transfer to new data and tasks. Specifically, we employ an image encoder, text encoder, and visual prompter to handle multi-modal inputs, enabling to simultaneously solve various object-centric downstream tasks while maintaining state-of-the-art performance. Demonstrated through extensive training on over five million images from diverse benchmarks, GLEE exhibits remarkable versatility and improved generalization performance, efficiently tackling downstream tasks without the need for task-specific adaptation. By integrating large volumes of automatically labeled data, we further enhance its zero-shot generalization capabilities. Additionally, GLEE is capable of being integrated into Large Language Models, serving as a foundational model to provide universal object-level information for multi-modal tasks. We hope that the versatility and universality of our method will mark a significant step in the development of efficient visual foundation models for AGI systems. The model and code will be released at https://glee-vision.github.io .

연구 동기 및 목표

  • 이미지 및 영상에서 다양한 객체 중심 비전 작업에 대해 일반화되는 통합적이고 확장 가능한 기반 모델을 개발한다.
  • 기존 시각 기반 모델이 태스크별로 특화되어 있거나 전반적인 이미지 특징에만 집중하는 한계를 극복한다.
  • 다양한 수준의 지도 정보를 가진 다중 해상도 및 다중 소스 데이터를 활용해 강력한 zero-shot 전이 성능을 달성한다.
  • 시각적 프롬프트(점, 상자, 스케치 등)를 통한 실시간 사용자 상호작용을 지원하는 상호작용형 분할 및 추적을 가능하게 한다.
  • 대규모 언어 모델과 통합되어 다중모달 AGI 시스템의 통합 시각 인식 백본으로 기능할 수 있도록 한다.

제안 방법

  • 이미지 인코더, 텍스트 인코더, 시각적 프롬프트 기반의 통합 프레임워크를 사용해 다중모달 입력(이미지 + 텍스트 + 시각적 프롬프트)을 처리한다.
  • 다양한 데이터셋에서 옵티멀한 약 500만 장의 이미지를 활용해 다양한 애너테이션 해상도(경계상자, 마스크, 언어 기반 표현 등)를 가진 공동 훈련 파라다임을 적용한다.
  • 자동으로 레이블링된 데이터를 통합해 zero-shot 일반화 성능를 향상시키고 인간 애너테이션 데이터 의존도를 줄인다.
  • 모든 후행 태스크에서 동시에 성능 향상을 이끌어내기 위해 태스크 간 최적화를 통합하는 일관된 학습 전략을 적용한다.
  • 트랜스포머 기반 어텐션 메커니즘을 활용해 이전 프레임의 마스크와 프롬프트 특징(예: 점, 상자)을 융합함으로써 상호작용형 분할 및 추적을 구현한다.
  • ODinW와 같은 오픈월드 데이터셋에서 전체 모델 미세조정 및 소수의 샘플에 기반한 적응을 지원하는 확장 가능한 훈련 파이프라인을 설계한다.

실험 결과

연구 질문

  • RQ1한 개의 기반 모델이 태스크별 적응 없이 다양한 객체 중심 비전 작업에서 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ2다양한 해상도와 지도 수준을 가진 다중 소스 데이터를 공동으로 훈련하는 것이 zero-shot 일반화 성능 향상에 얼마나 효과적인가?
  • RQ3시각적 프롬프트(점, 상자, 스케치 등)는 이미지 및 영상 환경에서 상호작용형 분할 및 추적를 얼마나 잘 지원하는가?
  • RQ4ODinW와 같은 오픈월드 데이터셋에서 소수의 샘플 및 zero-shot 설정에서 모델의 성능은 어떠한가?
  • RQ5모델가 대규모 언어 모델에 효과적으로 통합되어 통합 시각 인식 모듈로 기능할 수 있는가?

주요 결과

  • GLEE는 COCO, LVIS, RefCOCO 등의 벤치마크에서 감지, 분할, 기준 지정, 추적 등 15개 이상의 객체 중심 작업에서 최신 기술 수준의 zero-shot 성능를 달성한다.
  • ODinW 데이터셋에서 GLEE는 1-shot 설정에서 mAP 72.6% (IoU=0.50:0.95)를 기록했고, 10-shot 설정에서는 74.1%를 달성하여 강력한 소수의 샘플 전이 능력을 입증한다.
  • GLEE-Plus는 전체 미세조정을 통해 LVIS에서 89.7% AP, RefCOCO+에서 83.6% AP를 기록하며, 이전 모델인 GLIP-L 및 DyHead를 능가한다.
  • GLEE-Pro는 COCO test-dev 세트에서 92.0% AP, RefCOCO에서 80.6% AP를 기록하여 오픈 어휘 및 언어 기반 표현 작업에서 뛰어난 성능를 보였다.
  • 시각적 프롬프트를 통한 상호작용형 분할 및 추적은 고정밀도로 이미지 및 영상 환경에서 작동하며, 정성적 분석 및 온라인 데모 결과로 검증되었다.
  • 자동으로 레이블링된 데이터와 다중 소스 지도 정보 통합으로 인해, 예상치 못한 카테고리 및 도메인으로의 일반화 능력이 뛰어나며 성능 향상이 이루어졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.