Skip to main content
QUICK REVIEW

[論文レビュー] EVP: Enhanced Visual Perception using Inverse Multi-Attentive Feature Refinement and Regularized Image-Text Alignment

Mykola Lavreniuk, Shariq Farooq Bhat|arXiv (Cornell University)|Dec 13, 2023
Advanced Vision and Imaging被引用数 4
ひとこと要約

この論文は、Stable Diffusion U-Netバックボーンを活用して、逆マルチアテンション特徴精錬(IMAFR)と正則化された画像・テキストアライメント(RITA)を用いることで視覚的認識を向上させる新規なビジョンモデルEVPを提案する。EVPは、NYU Depth v2で11.8%のRMSE低減(0.254から0.224)を達成し、KITTIでは新たなSOTAを樹立する単一画像深度推定で最先端の性能を発揮するとともに、RefCOCOで2.53のIoU向上を達成する参照セグメンテーションでも最先端性能を実現した。

ABSTRACT

This work presents the network architecture EVP (Enhanced Visual Perception). EVP builds on the previous work VPD which paved the way to use the Stable Diffusion network for computer vision tasks. We propose two major enhancements. First, we develop the Inverse Multi-Attentive Feature Refinement (IMAFR) module which enhances feature learning capabilities by aggregating spatial information from higher pyramid levels. Second, we propose a novel image-text alignment module for improved feature extraction of the Stable Diffusion backbone. The resulting architecture is suitable for a wide variety of tasks and we demonstrate its performance in the context of single-image depth estimation with a specialized decoder using classification-based bins and referring segmentation with an off-the-shelf decoder. Comprehensive experiments conducted on established datasets show that EVP achieves state-of-the-art results in single-image depth estimation for indoor (NYU Depth v2, 11.8% RMSE improvement over VPD) and outdoor (KITTI) environments, as well as referring segmentation (RefCOCO, 2.53 IoU improvement over ReLA). The code and pre-trained models are publicly available at https://github.com/Lavreniuk/EVP.

研究の動機と目的

  • 従来の手法を超えて特徴学習と画像・テキストアライメントを強化することで、単一画像からのメトリック深度推定を改善すること。
  • VPDの限界、特に特徴アライメントと境界の明瞭さの面で、新たなアーキテクチャ的要素を導入して改善すること。
  • 剛性のあるクラステンプレートではなく、自由形式の視覚言語生成テキスト記述を用いることで、視覚タスクにおけるロバストなゼロショットおよびフェイントショット一般化を可能にすること。
  • 提案されたアーキテクチャが、深度推定や参照セグメンテーションを含む多様なビジョンタスクにおいて有効であることを示すこと。
  • 最小限のファインチューニングで事前学習済み拡散特徴を活用できる、公開可能で高性能なモデルを提供すること。

提案手法

  • マルチヘッドアテンションを用いて複数のピラミッドレベルの特徴を統合することで、空間的および意味的表現を強化する逆マルチアテンション特徴精錬(IMAFR)モジュールを提案する。
  • BLIP-2から得られる自由形式キャプションを活用して統一的かつ豊富なテキスト埋め込みを生成する正則化された画像・テキストアライメント(RITA)モジュールを導入する。これにより、画像特徴とのクロスアテンションアライメントが向上する。
  • ZoeDepthにインspiredされたメトリックバインの分類ベースのデコーダーを採用することで、離散的深度分布の学習を可能にし、より正確な深度予測を実現する。
  • 事前学習済みのStable Diffusion U-Netを視覚エンコーダーとして採用し、大規模な画像・テキスト事前学習から得られる豊富なマルチモodal特徴を活用する。
  • U-Netのスキップ接続を横断するマルチスケール特徴精錬戦略を採用することで、あらゆるスケールでの特徴精錬を強化する。
  • 訓練中にCLIPテキストエンコーダーの重みをファインチューニングすることで、特に自由形式記述を用いる場合に画像とテキスト表現間のアライメントを向上させる。

実験結果

リサーチクエスチョン

  • RQ1階層的または固定アグリゲーションと比較して、逆マルチアテンション特徴アグリゲーションは単一画像深度推定における特徴表現を向上させ得るか?
  • RQ2テンプレートベースのクラス記述ではなく、自由形式の視覚言語生成キャプションを用いることで、画像・テキストアライメントと下流タスクのパフォーマンスが向上するか?
  • RQ3メトリックバインを備えた分類ベースのデコーダーが、事前学習済み拡散バックボーンと組み合わせることで、深度推定精度を顕著に向上させ得るか?
  • RQ4提案されたアーキテクチャは、深度推定や参照セグメンテーションを含む多様なビジョンタスクにどの程度一般化可能か?
  • RQ5IMAFRおよびRITAモジュールの統合は、ベースラインのVPDアーキテクチャと比較して、モデルのパフォーマンスにどの程度の影響を与えるか?

主な発見

  • NYU Depth v2ベンチマークにおいて、EVPはRMSEを11.8%相対的に低減(0.254から0.224)し、屋内単一カメラ深度推定分野で新たなSOTAを樹立した。
  • KITTIデータセットでは、EVPは7つの評価指標すべてにおいて、以前のSOTA手法GEDepthを上回り、屋外深度推定分野でも新たなSOTAを確立した。
  • RefCOCOにおける参照セグメンテーションでは、EVPはIoU 76.35を達成し、以前のSOTA手法ReLAと比較して2.53ポイントの向上を示した。
  • アブレーションスタディの結果、IMAFR、メトリックバイン、個別CLIP埋め込み(1画像あたり1つのベクトル)の組み合わせが最良のパフォーマンスを発揮し、個別CLIPベクトル戦略(表12の行12)が最適であることが確認された。
  • 訓練中にCLIP重みを固定すると性能が劣化する一方、CLIPのファインチューニングによりアライメントと結果が顕著に向上し、特に自由形式キャプションを用いる場合に顕著であった。
  • モデルの性能は、画像・テキストアライメント戦略に最も敏感であり、明示的なクラスラベルがなくても、BLIP-2から得られる自由形式キャプションがテンプレートベースの記述を上回る性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。