Skip to main content
QUICK REVIEW

[논문 리뷰] Universal Instance Perception as Object Discovery and Retrieval

Bin Yan, Yi Jiang|arXiv (Cornell University)|2023. 03. 12.
Multimodal Machine Learning Applications인용 수 5
한 줄 요약

이 논문은 다양한 작업—예를 들어 객체 검출, 인스턴스 세그멘테이션, 언어 표현 이해, 영상 추적—을 하나의 프롬프트 유도형 객체 탐지 및 검색 프레임워크로 통합하는 유일한 인스턴스 인식 모델인 UNINEXT를 제안한다. 초기 특징 융합과 유연한 트랜스포머 기반 디코더를 활용하여, 단일이고 파rameter 효율적인 모델로 20개의 벤치마크에서 최신 기술 성능을 달성한다.

ABSTRACT

All instance perception tasks aim at finding certain objects specified by some queries such as category names, language expressions, and target annotations, but this complete field has been split into multiple independent subtasks. In this work, we present a universal instance perception model of the next generation, termed UNINEXT. UNINEXT reformulates diverse instance perception tasks into a unified object discovery and retrieval paradigm and can flexibly perceive different types of objects by simply changing the input prompts. This unified formulation brings the following benefits: (1) enormous data from different tasks and label vocabularies can be exploited for jointly training general instance-level representations, which is especially beneficial for tasks lacking in training data. (2) the unified model is parameter-efficient and can save redundant computation when handling multiple tasks simultaneously. UNINEXT shows superior performance on 20 challenging benchmarks from 10 instance-level tasks including classical image-level tasks (object detection and instance segmentation), vision-and-language tasks (referring expression comprehension and segmentation), and six video-level object tracking tasks. Code is available at https://github.com/MasterBin-IIAU/UNINEXT.

연구 동기 및 목표

  • 이미지 수준의 검출에서 영상 추적에 이르기까지 분산된 인스턴스 인식 작업들을 하나의 통합된 프레임워크로 통합하기 위해.
  • 작업별로 특화된 모델의 한계—중복된 파라미터, 지식 전이의 부재, 다양한 레이블 어휘 간 공동 학습의 어려움—을 극복하기 위해.
  • 아키텍처 변경 없이 카테고리 이름, 언어 표현 또는 참조 애너테이션을 통해 유연하고 프롬프트 기반의 객체 인식을 가능하게 하기 위해.
  • 다양한 작업 간 공동 학습을 통해 대규모 다중 작업 데이터를 활용함으로써 자원이 적은 작업의 성능을 향상시키기 위해.
  • 통합 아키텍처를 통해 여러 작업 간 파라미터 공유를 통해 파rameter 효율성과 계산 자원 절감을 달성하기 위해.

제안 방법

  • 10개의 인스턴스 인식 작업을 하나의 프롬프트 기반 객체 탐지 및 검색 파라다임으로 재구성하여, 프롬프트가 N개의 객체 후보를 탐지하고 인스턴스-프롬프트 매칭 점수를 통해 검색하도록 유도한다.
  • 다양한 프롬프트 유형(텍스트 또는 시각적 참조)을 공유 표현 공간에 매핑하기 위해 참조 텍스트 인코더와 시각적 인코더를 갖춘 프롬프트 생성 모듈을 도입한다.
  • 시각적 특징과 프롬프트 임베딩을 인스턴스 디코더 이전에 연결하거나 주목을 통해 융합하는 초기 융합 모듈을 사용하여 깊은 다중 모odal 상호작용을 가능하게 한다.
  • 트랜스포머 기반 객체 검출기로 인스턴스 디코더를 사용하여 N개의 객체 후보를 생성하고, 프롬프트와의 학습된 매칭 점수를 기반으로 가장 관련성이 높은 인스턴스를 검색한다.
  • 프롬프트 임베딩에 따라 동적으로 쿼리 학습을 조정하여, 특히 추적 및 세그멘테이션 작업에서 검출된 인스턴스 간의 관계를 더 잘 포착한다.
  • 단일 모델 아키텍처와 공유 파라미터를 사용함으로써, 서로 다른 레이블 공간과 데이터 분포를 가진 작업 간 공동 학습을 가능하게 하여 고정 크기의 분류기 제약를 피한다.

실험 결과

연구 질문

  • RQ1일관된 프레임워크를 사용하여 검출, 세그멘테이션, 추적, 언어 표현 이해와 같은 다양한 인스턴스 인식 작업을 단일 통합 모델이 효과적으로 해결할 수 있는가?
  • RQ2특히 희귀하거나 복잡한 참조 작업에서, 시각적 특징과 프롬프트 임베딩의 초기 융합이 다양한 프롬프트 모odal 간 성능에 어떤 영향을 미치는가?
  • RQ3다중 작업 인스턴스 인식 맥락에서 동적 쿼리 초기화와 정적 쿼리 초기화의 상대적 이점은 무엇인가?
  • RQ4다양한 인스턴스 인식 작업 간 공동 학습이 일반화 능력과 성능 향상에 얼마나 기여하는가, 특히 자원이 적은 벤치마크에서의 성능 향상은 어떠한가?
  • RQ5통합 모델이 작업별 특화된 모델보다 더 뛰어난 성능을 달성하면서도 더 높은 파라미터 효율성을 확보할 수 있는가?

주요 결과

  • UNINEXT는 객체 검출(COCO에서 AP 66.2), 언어 표현 세그멘테이션(RefCOCO에서 P@0.5 71.1), 영상 인스턴스 세그멘테이션(Youtube-VIS 2019에서 ViT-H 백본으로 AP 76.8)을 포함한 10개의 인스턴스 수준 작업에서 20개의 도전적인 벤치마크에서 최신 기술 성능을 달성한다.
  • 제거 실험에서 초기 특징 융합를 제거하면 VOS에서 마스크 품질(J&F)이 21.4점 하락함을 확인하여, 프롬프트 기반 작업에서 다중 모달 상호작용의 핵심적 역할을 입증한다.
  • 다양한 작업에서 동적 쿼리 생성이 정적 쿼리보다 略적으로 뛰어난 성능을 보였지만, VIS에서는 정적 쿼리가 2.8 AP 높은 성능을 기록하여 장기적인 시퀀스에서 인스턴스 간 관계를 더 잘 모델링할 수 있음을 시사한다.
  • 통합 모델은 작업별 특화 모델 대비 객체 검출에서 +0.5 AP, REC에서 +2.1 P@0.5, VOS에서 +2.8 J&F, RVOS에서 +4.0 J&F, VIS에서 +2.9 AP의 성능 향상을 기록하여 공동 학습의 이점을 입증한다.
  • UNINEXT는 뛰어난 파라미터 효율성을 확보하여, 작업별 특화 모델이 별도의 학습 및 추론 파이프라인을 필요로 하는 것과 달리, 모든 작업에 대해 단일 모델을 공유함으로써 계산의 중복을 줄였다.
  • 모델는 도메인과 작업 간에 잘 일반화되며, 다양한 데이터에서의 공동 프리트레인을 통해 제로샷 및 피셔샷 성능이 향상됨을 보여주며, 특히 R-VOS와 MOTS와 같은 자원이 적은 작업에서 두드러진 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.