[論文レビュー] DINO-X: A Unified Vision Model for Open-World Object Detection and Understanding
DINO-X は、大規模な 100M サンプルのグランドニングデータセットを活用し、テキスト、視覚、カスタマイズ可能なマルチモーダルプロンプトをサポートすることで、オープンワールドのオブジェクト検出および理解において最先端の性能を達成する統合的でオブジェクト中心のビジョンモデルです。プロンプトフリーの検出、セグメンテーション、ポーズ推定、ドメインカプションが可能で、DINO-X Pro モデルは COCO で 56.0 AP、レアな LVIS クラスでは 63.3 AP を達成し、前回の SOTA よりも 5.8 AP の向上を記録しました。
In this paper, we introduce DINO-X, which is a unified object-centric vision model developed by IDEA Research with the best open-world object detection performance to date. DINO-X employs the same Transformer-based encoder-decoder architecture as Grounding DINO 1.5 to pursue an object-level representation for open-world object understanding. To make long-tailed object detection easy, DINO-X extends its input options to support text prompt, visual prompt, and customized prompt. With such flexible prompt options, we develop a universal object prompt to support prompt-free open-world detection, making it possible to detect anything in an image without requiring users to provide any prompt. To enhance the model's core grounding capability, we have constructed a large-scale dataset with over 100 million high-quality grounding samples, referred to as Grounding-100M, for advancing the model's open-vocabulary detection performance. Pre-training on such a large-scale grounding dataset leads to a foundational object-level representation, which enables DINO-X to integrate multiple perception heads to simultaneously support multiple object perception and understanding tasks, including detection, segmentation, pose estimation, object captioning, object-based QA, etc. Experimental results demonstrate the superior performance of DINO-X. Specifically, the DINO-X Pro model achieves 56.0 AP, 59.8 AP, and 52.4 AP on the COCO, LVIS-minival, and LVIS-val zero-shot object detection benchmarks, respectively. Notably, it scores 63.3 AP and 56.5 AP on the rare classes of LVIS-minival and LVIS-val benchmarks, improving the previous SOTA performance by 5.8 AP and 5.0 AP. Such a result underscores its significantly improved capacity for recognizing long-tailed objects.
研究の動機と目的
- 多様で未知のカテゴリにわたるオープンワールドのオブジェクト検出と理解をサポートする統合ビジョンモデルの開発。
- 長尾分布におけるオブジェクト検出の限界を克服するため、テキスト、視覚、カスタマイズ可能なプロンプト入力を柔軟に可能とし、プロンプトフリー検出を実現。
- 10000万件の高品質グランドニングサンプルを用いた大規模事前学習により、オブジェクトレベルの基礎的表現を強化。
- 検出、セグメンテーション、キーポイント、言語の複数のパーミッションヘッドを統合し、高密度でマルチタスクのオブジェクト理解を実現。
- エッジデバイスへの実用的展開を最適化するため、エッジデバイス向けに軽量化された DINO-X Edge モデルを導入。
提案手法
- 一貫したオブジェクトレベル表現学習を実現するため、Grounding DINO 1.5 と同一のトランスフォーマー基盤のエンコーダデコーダアーキテクチャを採用。
- テキスト、視覚、カスタマイズ可能なプロンプト埋め込みの3種類のプロンプトタイプを導入し、多様な検出シナリオをサポート。
- プロンプトフリー検出を可能にするユニバーサルオブジェクトプロンプトを開発し、ユーザー入力なしで任意のオブジェクトを検出可能に。
- 強力なオープンボキャブラリー一般化を実現するため、10000万件を超える高品質グランドニングサンプルから構成される大規模でキュレート済みのデータセット「Grounding-100M」を事前学習に活用。
- ボックスヘッド(検出)、マスクヘッド(セグメンテーション)、キーポイントヘッド(ポーズ推定)、言語ヘッド(ドメインカプション)の複数のパーミッションヘッドを統合。
- 高速な推論とエッジデバイスへのデプロイを最適化しながら、高い性能を維持する DINO-X Edge モデルを設計。
実験結果
リサーチクエスチョン
- RQ1統合的ビジョンモデルは、多様で長尾分布に偏ったカテゴリにわたるオープンワールドのオブジェクト検出において、最先端の性能を達成できるか?
- RQ2プロンプトフリー検出は、ユーザーがプロンプトを入力しない状況でも、普遍的なオブジェクト認識を可能にするか?
- RQ3大規模グランドニングデータセットでの事前学習は、ゼロショット一般化およびマルチタスク認識能力をどの程度向上させるか?
- RQ4テキスト、視覚、カスタマイズ可能なマルチモーダルプロンプトのサポートは、レアまたは説明が難しいシナリオにおける検出のロバスト性を顕著に向上させるか?
- RQ51つのモデルが、高い精度と効率性を兼ね備えて、検出、セグメンテーション、ポーズ推定、ドメインカプションを統合的に効果的に行えるか?
主な発見
- DINO-X Pro モデルは、COCO のゼロショット検出ベンチマークで 56.0 AP を達成し、新たな SOTA を樹立。
- LVIS-minival ベンチマークでは 59.8 AP を記録し、Grounding DINO 1.6 Pro よりもレアクラスで 5.8 AP の向上を達成。
- レアな LVIS クラスでは、LVIS-minival で 63.3 AP、LVIS-val で 56.5 AP を達成し、それぞれ Grounding DINO 1.5 Pro よりも 7.2 AP および 11.9 AP の向上を記録。
- モデルはプロンプトフリー検出をサポートし、ユーザー入力なしで画像内の任意のオブジェクトを検出可能。
- DINO-X は高密度領域カプション、オブジェクトベースの視覚的質問応答、セグメンテーションおよびポーズ推定を含むマルチタスク認識を実現。
- DINO-X Edge モデルは高速推論を最適化されており、エッジデバイスへのデプロイに適しており、実用的応用範囲を拡張。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。