Skip to main content
QUICK REVIEW

[論文レビュー] GridCLIP: One-Stage Object Detection by Grid-Level CLIP Representation Learning

Jiayi Lin, Shaogang Gong|arXiv (Cornell University)|Mar 16, 2023
Multimodal Machine Learning Applications被引用数 6
ひとこと要約

GridCLIPは、長尾分布やオープンボリュームデータセットにおける検出性能を向上させるために、グリッドレベルおよび画像レベルのアライメントを導入することで、CLIPの視覚言語事前学習を活用するワンステージオブジェクト検出器を提案する。CLIPの包括的画像テキスト表現を細粒度のグリッドレベル特徴に適応させるとともに、画像レベル表現から汎用的な知識を蒸留することで、ViLDのような二段階検出器と同等の性能を達成しながら、学習が43倍速く、推論が5倍速い。

ABSTRACT

A vision-language foundation model pretrained on very large-scale image-text paired data has the potential to provide generalizable knowledge representation for downstream visual recognition and detection tasks, especially on supplementing the undersampled categories in downstream model training. Recent studies utilizing CLIP for object detection have shown that a two-stage detector design typically outperforms a one-stage detector, while requiring more expensive training resources and longer inference time. In this work, we propose a one-stage detector GridCLIP that narrows its performance gap to those of two-stage detectors, with approximately 43 and 5 times faster than its two-stage counterpart (ViLD) in the training and test process respectively. GridCLIP learns grid-level representations to adapt to the intrinsic principle of one-stage detection learning by expanding the conventional CLIP image-text holistic mapping to a more fine-grained, grid-text alignment. This differs from the region-text mapping in two-stage detectors that apply CLIP directly by treating regions as images. Specifically, GridCLIP performs Grid-level Alignment to adapt the CLIP image-level representations to grid-level representations by aligning to CLIP category representations to learn the annotated (especially frequent) categories. To learn generalizable visual representations of broader categories, especially undersampled ones, we perform Image-level Alignment during training to propagate broad pre-learned categories in the CLIP image encoder from the image-level to the grid-level representations. Experiments show that the learned CLIP-based grid-level representations boost the performance of undersampled (infrequent and novel) categories, reaching comparable detection performance on the LVIS benchmark.

研究の動機と目的

  • CLIPベースの表現を用いたオブジェクト検出において、ワンステージと二段階検出器の性能格差を解消すること。
  • 追加の画像キャプションデータやラベル付きデータを必要とせずに、長尾データセットにおける未サンプリング(希少および新規)カテゴリの検出を改善すること。
  • CLIPの包括的画像テキストマッピングを局所化されたグリッドレベル特徴に適応させることで、効率的かつ高速なワンステージ検出を可能にすること。
  • 画像レベル表現からグリッドレベル特徴への知識蒸留を検討し、より広範なカテゴリ一般化を実現すること。

提案手法

  • GridCLIPは、CLIPの画像レベル埋め込みをグリッドレベル特徴にマップするグリッドレベルアライメントを導入し、ベースカテゴリのCLIPテキスト埋め込みとアライメントさせる。
  • 訓練中に画像レベルアライメントを適用し、CLIPの画像レベル表現から得られる汎用的知識をグリッドレベル特徴に転送することで、ベースカテゴリおよび新規カテゴリの両方に利益をもたらす。
  • 検出に特化したデータに対する追加の微調整なしに、CLIPの事前学習済み視覚およびテキストエンコーダーを用いて高次元の視覚的および言語的埋め込みを生成する。
  • CLIPの画像エンコーダーの包括的表現から、検出器のグリッドレベル特徴への知識蒸留を実施し、オープンセット検出の能力を可能にする。
  • モデルは、CLIP最適化済みの視覚エンコーダー(例:ViT-B/32 または RN50×64)を用いて特徴マップを抽出し、グリッドおよび画像レベルの両方でテキスト埋め込みとアライメントさせる。
  • 検出器は、グリッドレベル特徴を入力として用いる標準的なワンステージヘッドアーキテクチャ(例:RetinaNetスタイル)を採用し、ボックスおよびカテゴリ予測を実行する。

実験結果

リサーチクエスチョン

  • RQ1CLIPの包括的画像テキストマッピングを局所化された特徴に適応させることで、ワンステージ検出器におけるグリッドレベルアライメントが、未サンプリングカテゴリの検出性能を向上させることができるか?
  • RQ2追加の微調整データを必要とせずに、画像レベルアライメントがオープンセット検出における新規(未観測)カテゴリへの一般化を向上させるか?
  • RQ3グリッドレベルおよび画像レベルアライメントの組み合わせが、LVIS v1.0のような長尾データセットにおける性能に与える影響は?
  • RQ4CLIPの画像レベル表現が同時に複数のオブジェクトカテゴリをどれほど効果的に捉えられるか、そしてそれが検出にどのように寄与するか?

主な発見

  • GridCLIPは、学習が43倍速く、推論が5倍速いにもかかわらず、LVIS v1.0における検出性能をViLDのような二段階検出器と同等に達成する。
  • 画像レベルアライメントにより、新規カテゴリの平均APが2.6ポイント向上し、ベースカテゴリの性能は維持される。
  • グリッドレベルアライメントは、最も希少な100カテゴリにおける性能を顕著に向上させ、クローズドセット検出においてベースラインモデルを上回る。
  • ViT-B/32およびRN50×64のCLIPエンコーダーは、それぞれ画像内カテゴリのリコール率(RC@300)が75%および60%を達成し、強力な多カテゴリ表現能力を示している。
  • 両アライメントの組み合わせにより、希少および新規カテゴリの効果的検出が可能となり、長尾分布の問題が緩和される。
  • 画像レベル表現からの効果的な知識蒸留のおかげで、GridCLIPは既存のワンステージCLIPベース検出器よりもオープンセット検出において優れた性能を示し、特に最も希少なカテゴリで顕著な優位性を示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。