Skip to main content
QUICK REVIEW

[論文レビュー] CLIP for All Things Zero-Shot Sketch-Based Image Retrieval, Fine-Grained or Not

Aneeshan Sain, Ayan Kumar Bhunia|arXiv (Cornell University)|Mar 23, 2023
Advanced Image and Video Retrieval Techniques被引用数 5
ひとこと要約

本論文は、ゼロショットスケッチベース画像検索(ZS-SBIR)のための画期的なプロンプトベースのCLIP適応手法を提案し、カテゴリレベルおよび細分化ZS-SBIRの両方で最先端の性能を達成した。スケッチ固有の視覚的プロンプトの導入、カテゴリ間のスケッチ・フォト特徴距離を統一する正則化損失、構造的対応を実現するパッチシャッフル技術により、従来の最先端手法と比較して、それぞれ24.8%および26.9%の精度向上を達成した。

ABSTRACT

In this paper, we leverage CLIP for zero-shot sketch based image retrieval (ZS-SBIR). We are largely inspired by recent advances on foundation models and the unparalleled generalisation ability they seem to offer, but for the first time tailor it to benefit the sketch community. We put forward novel designs on how best to achieve this synergy, for both the category setting and the fine-grained setting ("all"). At the very core of our solution is a prompt learning setup. First we show just via factoring in sketch-specific prompts, we already have a category-level ZS-SBIR system that overshoots all prior arts, by a large margin (24.8%) - a great testimony on studying the CLIP and ZS-SBIR synergy. Moving onto the fine-grained setup is however trickier, and requires a deeper dive into this synergy. For that, we come up with two specific designs to tackle the fine-grained matching nature of the problem: (i) an additional regularisation loss to ensure the relative separation between sketches and photos is uniform across categories, which is not the case for the gold standard standalone triplet loss, and (ii) a clever patch shuffling technique to help establishing instance-level structural correspondences between sketch-photo pairs. With these designs, we again observe significant performance gains in the region of 26.9% over previous state-of-the-art. The take-home message, if any, is the proposed CLIP and prompt learning paradigm carries great promise in tackling other sketch-related tasks (not limited to ZS-SBIR) where data scarcity remains a great challenge. Project page: https://aneeshan95.github.io/Sketch_LVM/

研究の動機と目的

  • スケッチベース画像検索におけるデータ不足を、CLIPのゼロショット一般化能力を活用することで解決すること。
  • CLIPを用いてカテゴリレベルおよび細分化の両設定で、効果的なゼロショットスケッチベース画像検索を可能にすること。
  • CLIPの一般化能力を保ちつつ、スケッチ・フォトアライメントに適応するためのプロンプト学習フレームワークを設計すること。
  • カテゴリレベルZS-SBIRに見られない、細分化ZS-SBIRにおける課題、例えば非一様な特徴距離とインスタンスレベルの構造的対応の必要性を克服すること。
  • 基礎モデル(例:CLIP)が低リソースのスケッチ関連ビジョンタスクに広く応用可能である可能性を示すこと。

提案手法

  • スケッチおよびフォト用のモality特化視覚プロンプトをCLIPの画像エンコーダーに組み込み、CLIPの重みを固定したまま三重損失を用いて学習する。
  • カテゴリ間の相対的スケッチ・フォト距離分布のKLダイバージェンスに基づく新しい正則化損失を導入し、特徴距離の一様性を強制する。
  • 同じ順列に従ってシャッフルされたスケッチおよびフォトパッチ間の対応関係をモデルが認識できるように学習するパッチシャッフル技術を提案し、インスタンスレベルの構造的アライメントを実現する。
  • 追加の性能向上を図るため、CLIPの層正規化パラメータの小さなサブセットを微調整する。
  • 語彙埋め込み(word2vec)の代わりに、手動で作成されたプロンプト(例:'[カテゴリ]の写真')を用いたCLIPのテキストエンコーダーを活用し、意味的転送を強化する。
  • アブレーションスタディを実施し、各構成要素の寄与度を検証する。これには、プロンプト長やプロンプト学習 vs. 手動で作成されたプロンプトの比較が含まれる。

実験結果

リサーチクエスチョン

  • RQ1プロンプト学習を用いてCLIPをゼロショットスケッチベース画像検索に効果的に適応可能であり、かつ従来手法を上回る性能を示すか?
  • RQ2CLIPの一般化能力を活用することで、ZS-SBIRにおけるカテゴリ間の意味的転送をどのように向上させられるか?
  • RQ3カテゴリレベルZS-SBIRに見られない、細分化ZS-SBIRにおける課題は何か。それらはどのように解決できるか?
  • RQ4このゼロショットスケッチ検索設定において、テキストプロンプトの学習は手動で作成されたプロンプトよりも性能を向上させるか?
  • RQ5細分化された詳細なモデリングの観点から、スケッチベース検索はキーワードベース検索と比較してどのように異なるか?

主な発見

  • 提案手法は、カテゴリレベルZS-SBIRにおけるSketchyデータセットでのmAP@allで24.8%の相対的向上を達成し、従来の最先端手法を上回った。
  • 細分化ZS-SBIRにおいて、SketchyデータセットでのTop-1精度が26.9%向上し、新たな最先端性能を樹立した。
  • f-ダイバージェンス正則化損失(Lδ)を削除すると、FG-ZS-SBIRにおけるTop-1精度が3.75%低下し、カテゴリ間の特徴距離の一様性を保つ上でその重要性が確認された。
  • パッチシャッフル損失(LPS)は、FG-ZS-SBIRにおけるTop-1精度に3.15%の寄与を示し、構造的対応関係を学習する有効性を裏付けた。
  • CLIPのテキストエンコーダーを用い、手動で作成されたプロンプトを適用した場合、word2vec埋め込みよりもTop-1精度が4.57%高い結果となり、視覚言語事前学習の価値を証明した。
  • 手動で作成されたプロンプトではなく、テキストプロンプトを学習することで、Top-1精度が2.36%低下した。これは、この文脈において、手動で作成された自然言語プロンプトの方が一般化性能に優れていることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。