Skip to main content
QUICK REVIEW

[論文レビュー] Towards In-context Scene Understanding

Ivana Balažević, David Steiner|arXiv (Cornell University)|Jun 2, 2023
Multimodal Machine Learning Applications被引用数 6
ひとこと要約

この論文では、最近傍(NN)検索を介して文脈学習のための特徴表現を強化する、新しい文脈的事前学習プロトコルで事前学習されたビジョントランスフォーマーモデルであるHummingbirdを紹介する。クロスインスタンスアテンションと空間アテンションプーリングを活用することで、微調整なしに、セマンティックセグメンテーションや深度推定といった密度的なシーン理解タスクで最先端のゼロショット性能を達成し、タスク固有の微調整モデルに近い精度を実現しながら、新しいタスクへの迅速かつデータ効率の良い適応を可能にする。

ABSTRACT

In-context learning$\unicode{x2013}$the ability to configure a model's behavior with different prompts$\unicode{x2013}$has revolutionized the field of natural language processing, alleviating the need for task-specific models and paving the way for generalist models capable of assisting with any query. Computer vision, in contrast, has largely stayed in the former regime: specialized decoders and finetuning protocols are generally required to perform dense tasks such as semantic segmentation and depth estimation. In this work we explore a simple mechanism for in-context learning of such scene understanding tasks: nearest neighbor retrieval from a prompt of annotated features. We propose a new pretraining protocol$\unicode{x2013}$leveraging attention within and across images$\unicode{x2013}$which yields representations particularly useful in this regime. The resulting Hummingbird model, suitably prompted, performs various scene understanding tasks without modification while approaching the performance of specialists that have been finetuned for each task. Moreover, Hummingbird can be configured to perform new tasks much more efficiently than finetuned models, raising the possibility of scene understanding in the interactive assistant regime.

研究の動機と目的

  • 従来、タスク固有の微調整を必要としているセマンティックセグメンテーションや深度推定などの密度的コンピュータビジョンタスクにおける文脈学習を可能にすること。
  • パrameter更新なしに迅速な適応が可能な非パrametricな検索に適した表現を生成する事前学習プロトコルの開発。
  • 自己教師ありビジョンモデルが、プロンプトベースの検索のみを用いて、密度的なシーン理解タスクで強力なゼロショット性能を達成できるかどうかの検証。
  • 検索ベースのシーン理解を可能にするために、異なる事前学習目的およびアーキテクチャ的要素の有効性を比較すること。
  • 1つの汎用モデルがプロンプト工学を用いて効率的に新しいビジョンタスクに適応でき、高価な微調整への依存を減らせるかどうかの実証。

提案手法

  • クロスインスタンスアテンションを適用する新しい事前学習プロトコル「文脈的事前学習」を提案。各画像の空間的特徴量を、他の画像からの特徴量のメモリバンクを用いて更新することで実現。
  • 文脈化された特徴グリッドを1つの画像レベル表現に要約する空間アテンションプーリングを導入。これにより、下流の検索のための表現品質が向上。
  • 検索ベースの監視を組み込んだコントラスト型自己教師あり目的を採用。モデルは、アノテーション付き例のメモリバンクから正しい特徴量を検索するように学習する。
  • 二重メモリメカニズムを採用:事前学習用のメモリバンク(自己教師ありのための特徴検索用)と推論用の評価メモリバンク(最近傍検索による推論用)。
  • 推論時にエンコーダーの特徴量を用いて最近傍検索を実行。これにより、モデルの更新なしにゼロショットでのタスク適応が可能。
  • ViT-BおよびViT-Lエンコーダーを用いてImageNet-22kでモデルを学習。メモリバンクサイズ、サンプリング戦略、事前学習目的のアブレーションを実施。
Figure 1: In-context scene understanding with nearest neighbor retrieval. On the left, we provide the system with a “prompt” of annotated images. On the right, we ask the system to describe new query images. The network computes dense features for each location and uses them to query features comput
Figure 1: In-context scene understanding with nearest neighbor retrieval. On the left, we provide the system with a “prompt” of annotated images. On the right, we ask the system to describe new query images. The network computes dense features for each location and uses them to query features comput

実験結果

リサーチクエスチョン

  • RQ1ビジョントランスフォーマーは、セマンティックセグメンテーションや深度推定のような密度的なシーン理解タスクにおける文脈学習をサポートするように事前学習可能か?
  • RQ2クロスインスタンスアテンションを用いた文脈的事前学習は、標準的な自己教師あり事前学習と比較して、ゼロショット検索性能をどのように向上させるか?
  • RQ3空間アテンションプーリングが、グローバルプーリングや[CLS]トークンと比較して、検索ベースのシーン理解に与える影響は何か?
  • RQ4事前学習段階で検索ベースの監視を適用することで、下流タスクへの一般化性能がどの程度向上するか?
  • RQ5精度、データ効率、適応速度の観点から、検索ベースの推論性能は微調整モデルと比較してどの程度優れているか?

主な発見

  • 最近傍検索のみを用いて、PASCAL VOCで70.5% mIoU、ADE20Kで30.7% mIoUを達成。完全に微調整されたモデルに近い性能を示す。
  • ViT-LとImageNet-22kでの事前学習を用いた場合、PASCAL VOCで84.1% mIoU、ADE20Kで50.8% mIoUを達成。強力なゼロショット一般化性能を示す。
  • 自己教師ありおよび検索ベースの目的の両方を用いて学習したモデル(Hummingbird++)は、ADE20Kで76.2% mIoUを達成。純粋な自己教師ありまたは検索監視ベースのベースラインを上回る性能。
  • 最近傍検索は微調整と比較して10倍のばらつきが少なく、ハイパーパramータースイープを必要としないため、信頼性が高く、効率的なオンライン評価の代理として有効。
  • より大きな事前学習および評価用メモリバンク(例:153,600特徴量)は、特にADE20Kのような大規模データセットでは性能を顕著に向上。
  • 提案された文脈的事前学習と空間アテンションプーリングは、MAE や DINO などの標準的な自己教師あり手法と比較して、検索に非常に効果的な表現を生成する。
Figure 2: Hummingbird model components.
Figure 2: Hummingbird model components.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。