[논문 리뷰] DINO-X: A Unified Vision Model for Open-World Object Detection and Understanding
DINO-X는 대규모 100M 건의 기반 데이터셋을 활용하고 다중 모odal 프롬프트(텍스트, 시각, 사용자 정의)를 지원함으로써 개방형 객체 검출 및 이해에서 최신 기술 수준의 성능을 달성하는 통합형, 객체 중심의 시각 모델이다. 프롬프트 없이도 검출, 세분화, 자세 추정, 밀도 높은 캡션 생성이 가능하며, DINO-X Pro 모델은 COCO에서 56.0 AP, 희귀 LVIS 클래스에서 63.3 AP를 기록하여 이전 최신 기술 수준 대비 5.8 AP 향상 달성.
In this paper, we introduce DINO-X, which is a unified object-centric vision model developed by IDEA Research with the best open-world object detection performance to date. DINO-X employs the same Transformer-based encoder-decoder architecture as Grounding DINO 1.5 to pursue an object-level representation for open-world object understanding. To make long-tailed object detection easy, DINO-X extends its input options to support text prompt, visual prompt, and customized prompt. With such flexible prompt options, we develop a universal object prompt to support prompt-free open-world detection, making it possible to detect anything in an image without requiring users to provide any prompt. To enhance the model's core grounding capability, we have constructed a large-scale dataset with over 100 million high-quality grounding samples, referred to as Grounding-100M, for advancing the model's open-vocabulary detection performance. Pre-training on such a large-scale grounding dataset leads to a foundational object-level representation, which enables DINO-X to integrate multiple perception heads to simultaneously support multiple object perception and understanding tasks, including detection, segmentation, pose estimation, object captioning, object-based QA, etc. Experimental results demonstrate the superior performance of DINO-X. Specifically, the DINO-X Pro model achieves 56.0 AP, 59.8 AP, and 52.4 AP on the COCO, LVIS-minival, and LVIS-val zero-shot object detection benchmarks, respectively. Notably, it scores 63.3 AP and 56.5 AP on the rare classes of LVIS-minival and LVIS-val benchmarks, improving the previous SOTA performance by 5.8 AP and 5.0 AP. Such a result underscores its significantly improved capacity for recognizing long-tailed objects.
연구 동기 및 목표
- 다양하고 알려지지 않은 카테고리에 걸쳐 개방형 객체 검출 및 이해를 지원하는 통합 시각 모델을 개발하는 것.
- 유연한 프롬프트 입력(텍스트, 시각, 사용자 정의)과 프롬프트 없이도 검출할 수 있도록 함으로써 장꼬리 분포 객체 검출의 한계를 극복하는 것.
- 100만 건 이상의 고품질 기반 샘플을 활용한 대규모 사전 훈련을 통해 기본 객체 수준 표현을 향상시키는 것.
- 검출, 세분화, 관절점 추정, 언어 등 여러 인지 헤드를 통합하여 다수의 작업을 수행하는 밀도 높은 다중 작업 객체 이해를 가능하게 하는 것.
- 실제 환경에서의 구현을 최적화하기 위해 엣지 디바이스용 경량 DINO-X Edge 모델을 도입하는 것.
제안 방법
- 객체 수준 표현 학습의 일관성을 확보하기 위해 Grounding DINO 1.5와 동일한 Transformer 기반 인코더-디코더 아키텍처를 채택한다.
- 다양한 검출 시나리오를 지원하기 위해 텍스트, 시각, 사용자 정의 프롬프트 임베딩의 세 가지 프롬프트 유형을 도입한다.
- 모든 객체를 사용자 입력 없이도 검출할 수 있도록 하는 통합형 객체 프롬프트를 개발하여 프롬프트 없는 검출을 가능하게 한다.
- 강건한 개방형 어휘 일반화를 위해 1억 건이 넘는 고품질 기반 샘플을 포함한 대규모 정제된 데이터셋인 Grounding-100M에서 사전 훈련한다.
- 박스 헤드(검출), 마스크 헤드(세분화), 관절점 헤드(자세 추정), 언어 헤드(밀도 높은 캡션 생성) 등 여러 인지 헤드를 통합한다.
- 강력한 성능 유지와 함께 엣지 디바이스에서의 빠른 추론 및 배포를 위해 DINO-X Edge 모델을 최적화한다.
실험 결과
연구 질문
- RQ1통합 시각 모델이 다양한 장꼬리 분포 카테고리에 걸쳐 개방형 객체 검출에서 최신 기술 수준의 성능을 달성할 수 있는가?
- RQ2사용자 제공 프롬프트 없이도 검출이 가능한 프롬프트 없는 검출이 보편적인 객체 인식을 얼마나 효과적으로 가능하게 하는가?
- RQ3대규모 기반 데이터셋에서의 사전 훈련이 제로샷 일반화 및 다중 작업 인지 능력을 얼마나 향상시키는가?
- RQ4다중 모달 프롬프트 지원(텍스트, 시각, 사용자 정의)이 희귀하거나 설명하기 어려운 상황에서 검출의 강건성을 얼마나 향상시키는가?
- RQ5한 번의 모델로 높은 정확도와 효율성을 동시에 확보하며 검출, 세분화, 자세 추정, 밀도 높은 캡션 생성을 공동으로 수행할 수 있는가?
주요 결과
- DINO-X Pro 모델은 COCO 제로샷 검출 벤치마크에서 56.0 AP를 기록하여 새로운 최신 기술 수준을 수립했다.
- LVIS-minival 벤치마크에서 DINO-X Pro는 59.8 AP를 기록했으며, Grounding DINO 1.6 Pro 대비 희귀 클래스에서 5.8 AP 향상 달성.
- 희귀 LVIS 클래스에서 DINO-X Pro는 LVIS-minival에서 63.3 AP, LVIS-val에서 56.5 AP를 기록하여 각각 Grounding DINO 1.5 Pro 대비 7.2 AP 및 11.9 AP 향상 달성.
- 모델은 프롬프트 없이도 검출이 가능하여 사용자 입력 없이도 이미지 내 어떤 객체든 검출할 수 있다.
- DINO-X는 밀도 높은 영역 캡션 생성, 객체 기반 시각 질문 응답, 세분화 및 자세 추정을 포함한 다중 작업 인지 기능을 지원한다.
- DINO-X Edge 모델은 빠른 추론을 최적화하여 엣지 디바이스에 배포하기 적합하며, 모델의 실용적 적용 범위를 넓혔다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.