Skip to main content
QUICK REVIEW

[論文レビュー] Harnessing Diffusion Models for Visual Perception with Meta Prompts

Qiang Wan, Zilong Huang|arXiv (Cornell University)|Dec 22, 2023
Generative Adversarial Networks and Image Synthesis被引用数 5
ひとこと要約

本論文では、学習可能なメタプロンプト—タスク固有の特徴を活性化し、階層的特徴を再編成することで焦点を高める学習可能な埋め込み—を用いて、事前学習済みのテキストから画像への拡散モデルを視覚的認識タスクに適応するための新規手法を提案する。本手法は、NYU Depth V2およびKITTIにおける深度推定で最先端性能を達成し、セマンティックセグメンテーションにおいてCityScapesで新たなSOTAを樹立した。

ABSTRACT

The issue of generative pretraining for vision models has persisted as a long-standing conundrum. At present, the text-to-image (T2I) diffusion model demonstrates remarkable proficiency in generating high-definition images matching textual inputs, a feat made possible through its pre-training on large-scale image-text pairs. This leads to a natural inquiry: can diffusion models be utilized to tackle visual perception tasks? In this paper, we propose a simple yet effective scheme to harness a diffusion model for visual perception tasks. Our key insight is to introduce learnable embeddings (meta prompts) to the pre-trained diffusion models to extract proper features for perception. The effect of meta prompts are two-fold. First, as a direct replacement of the text embeddings in the T2I models, it can activate task-relevant features during feature extraction. Second, it will be used to re-arrange the extracted features to ensures that the model focuses on the most pertinent features for the task on hand. Additionally, we design a recurrent refinement training strategy that fully leverages the property of diffusion models, thereby yielding stronger visual features. Extensive experiments across various benchmarks validate the effectiveness of our approach. Our approach achieves new performance records in depth estimation tasks on NYU depth V2 and KITTI, and in semantic segmentation task on CityScapes. Concurrently, the proposed method attains results comparable to the current state-of-the-art in semantic segmentation on ADE20K and pose estimation on COCO datasets, further exemplifying its robustness and versatility.

研究の動機と目的

  • 事前学習済みのテキストから画像への拡散モデルを、外部のキャプションモデルやデータセット固有のラベルに依存せずに、視覚的認識タスクに適応する課題に対処すること。
  • タスク固有の認識に適応するため、動的に特徴を活性化・再編成できる軽量でエンドツーエンド微調整可能なプロンプト機構を開発すること。
  • 拡散モデルが内蔵するノイズ除去プロセスを活用した再帰的精錬訓練戦略により、特徴の質とモデルの適応性を向上させること。
  • 深度推定やセマンティックセグメンテーションのような多様な認識タスクに一般化可能な、効率的かつ効果的な特徴抽出を可能にすること。

提案手法

  • テキスト埋め込みの代わりに、タスク固有の条件入力として機能する「メタプロンプト」としての学習可能な埋め込みを導入し、関連する特徴を活性化する。
  • 複数スケールの特徴マップとメタプロンプトとの間でドット積を計算し、タスクに最も関連する特徴を再編成・強調する。
  • 同じUNetパラメータを複数のノイズ除去ステップで繰り返し使用する再帰的精錬訓練戦略を実装し、特徴分布の変化に適応するための調整付きタイムステップ埋め込みを用いる。
  • 入力画像を共有のVQVAEエンコーダーで潜在空間に圧縮し、共有のUNetとタスク固有のメタプロンプトを用いて反復的なノイズ除去を実行する。
  • 従来の損失関数(例:深度推定にはL1損失、セグメンテーションには交差エントロピー)を用いて、エンドツーエンドで全システムを訓練する。
  • 最終的なアテンション重み付き特徴を双線形補間でアップサンプリングし、可視化(ヒートマップ)を生成することで、各メタプロンプトの注目領域を解釈する。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みの拡散モデルを、バックボーンの微調整なしに視覚的認識タスクの特徴抽出器として効果的に再利用できるか?
  • RQ2深度推定やセマンティックセグメンテーションのような多様な認識タスクに適応するため、メタプロンプトをどのように設計すれば、特徴を動的に活性化・再編成できるか?
  • RQ3共有のUNetパラメータを用いた再帰的精錬戦略は、認識タスクにおける特徴品質を向上させるか?また、単一フォワードによる特徴抽出と比較して、その効果はいかにか?
  • RQ4調整付きタイムステップ埋め込みは、反復的ノイズ除去中に生じる分布シフトをどの程度軽減できるか?また、その影響は性能にどのように現れるか?

主な発見

  • 提案手法は、深度推定において新たな最先端性能を達成し、NYU Depth V2およびKITTIベンチマークで新たなSOTAを樹立した。
  • セマンティックセグメンテーションにおいてCityScapesで新たなSOTAを達成し、異なるデータセット間での強力な一般化能力を示した。
  • ADE20Kでは、現在の最先端手法と同等の性能を達成した。これは、本手法の強靭性と多様性を示している。
  • ポーズ推定タスクにおいてもCOCOで競争力ある性能を示し、多様な認識タスクへの適応性をさらに裏付けた。
  • 精錬ステップ数を増やすほど性能が向上し、再帰的ノイズ除去戦略が特徴品質の向上に有効であることを確認した。
  • 最適なメタプロンプト数は、深度推定で50、セマンティックセグメンテーションで150であった。これは、タスクに応じたプロンプト効率性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。