Skip to main content
QUICK REVIEW

[論文レビュー] A Zero-Shot Framework for Sketch-based Image Retrieval

Sasi Kiran Yelamarthi, Shiva Krishna Reddy|arXiv (Cornell University)|Jul 31, 2018
Advanced Image and Video Retrieval Techniques参考文献 5被引用数 9
ひとこと要約

本論文は、既存のSBIRモデルがクラス固有のマッピングを学習するのではなく、形状ベースのアライメントを学習するという限界を克服するゼロショットスケッチベース画像検索(ZS-SBIR)フレームワークを提案する。テスト時に未知のクラスが含まれるSketchyデータセットを用いたベンチマークを導入し、生成的スケッチから画像への翻訳に条件付き変分オートエンコーダー(CVAE)と条件付き対抗的オートエンコーダー(CAAE)を採用することで、生成モデルがゼロショット一般化において判別的ベースラインを著しく上回ることを示した。CVAEを用いた精度は0.333に達した。

ABSTRACT

Sketch-based image retrieval (SBIR) is the task of retrieving images from a natural image database that correspond to a given hand-drawn sketch. Ideally, an SBIR model should learn to associate components in the sketch (say, feet, tail, etc.) with the corresponding components in the image having similar shape characteristics. However, current evaluation methods simply focus only on coarse-grained evaluation where the focus is on retrieving images which belong to the same class as the sketch but not necessarily having the same shape characteristics as in the sketch. As a result, existing methods simply learn to associate sketches with classes seen during training and hence fail to generalize to unseen classes. In this paper, we propose a new benchmark for zero-shot SBIR where the model is evaluated in novel classes that are not seen during training. We show through extensive experiments that existing models for SBIR that are trained in a discriminative setting learn only class specific mappings and fail to generalize to the proposed zero-shot setting. To circumvent this, we propose a generative approach for the SBIR task by proposing deep conditional generative models that take the sketch as an input and fill the missing information stochastically. Experiments on this new benchmark created from the "Sketchy" dataset, which is a large-scale database of sketch-photo pairs demonstrate that the performance of these generative models is significantly better than several state-of-the-art approaches in the proposed zero-shot framework of the coarse-grained SBIR task.

研究の動機と目的

  • 現在のSBIR評価における欠陥を是正する。これは、粗い粒度のクラスベースの検索指標がクラス固有の学習を促進するためである。
  • 訓練時に確認していない新しいクラスでテストされる現実的なゼロショット設定を提案し、クラスラベルを越えた一般化を促進する。
  • Sketchyデータセットを慎重に分割することで、SBIRモデルのゼロショット評価を可能にする新しいベンチマークを構築する。
  • 生成モデルがスケッチと画像の間で意味的な形状ベースのアライメントを学習できることを示し、ゼロショット一般化を向上させることを目的とする。
  • 条件付き生成モデル(CVAE、CAAE)が、提案されたゼロショット設定において、最先端の判別的SBIRモデルを上回ることを示す。

提案手法

  • Sketchyデータセットを学習用クラスとテスト用クラスに分割し、訓練時とテスト時のクラスに重複がないようにすることで、ゼロショットSBIRベンチマークを提案する。
  • 条件付き変分オートエンコーダー(CVAE)と条件付き対抗的オートエンコーダー(CAAE)を、潜在空間におけるスケッチ入力から画像特徴を生成するように適応する。
  • 再構成損失と対抗的訓練を用いてモデルを学習し、スケッチから現実的かつ多様な画像生成を促進する。
  • 生成された画像特徴を用いてデータベースから画像を検索し、平均精度k(mP@k)を用いて性能を評価する。
  • 同じ生成フレームワークをゼロショット画像分類タスクに適用し、より広範な適用可能性を示す。
  • 人的なラベル付けが不要な自動的で人為的バイアスのない指標を用いてモデルを評価する。

実験結果

リサーチクエスチョン

  • RQ1既存のSBIRモデルは、ゼロショット設定で未知のクラスに一般化できるか?
  • RQ2SBIRにおける生成的アプローチは、判別的モデルに比べてより優れたゼロショット一般化を達成できるか?
  • RQ3条件付き生成モデルは、訓練時に同じクラスを確認しなくても、スケッチと画像の間で意味的な形状ベースのアライメントを学習できるか?
  • RQ4再構成損失と対抗的訓練は、ゼロショット設定における生成的SBIRモデルの性能にどのように影響するか?
  • RQ5提案されたフレームワークは、スケッチベース検索を超えた他のゼロショット学習タスクへも拡張可能か?

主な発見

  • 判別的設定で学習された既存のSBIRモデルは、ゼロショット設定では性能が著しく低下し、直接回帰の精度は0.066まで低下する。これは強いクラス固有の学習が行われていることを示している。
  • 提案されたCVAEモデルは、ZS-SBIRベンチマークで平均精度0.333を達成し、すべての先行研究の最先端手法を著しく上回った。
  • CAAEモデルは精度0.260を達成し、対抗的訓練を用いた生成モデルが有効であるが、CVAEに比べて安定性に欠けることが示された。
  • CVAEモデルは滑らかな訓練収束を示し、再構成損失を用いることで精度が3%向上した。これは訓練の安定性が優れていることを示している。
  • 定性的な結果から、検索された画像はスケッチのアウトラインとよく一致しており、誤検出の多くは妥当な形状類似性を示している。これは、強固なアライメント学習が行われていることを示している。
  • t-SNEによる特徴可視化により、生成された特徴が実際の画像特徴に近く、分布の複数のモードを捉えていることが確認された。これは、潜在空間モデリングが効果的に行われていることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。