Skip to main content
QUICK REVIEW

[論文レビュー] Bi-Directional Domain Translation for Zero-Shot Sketch-Based Image Retrieval

Jiangtong Li, Zhixin Ling|arXiv (Cornell University)|Nov 29, 2019
Advanced Image and Video Retrieval Techniques参考文献 59被引用数 4
ひとこと要約

本稿では、ゼロショットスケッチベース画像検索(ZS-SBIR)のためのバイディレクショナルドメイントランスレーション(BDT)フレームワークを提案する。このフレームワークは、画像特徴を構造と外観のコンponentsに分離することで、クロスドメイントランスレーションと構造ベースの検索を可能にする。本手法は最先端の性能を達成し、従来手法と比較してSketchyでは約8%、TU-Berlinでは5%以上、検索精度を向上させた。

ABSTRACT

The goal of Sketch-Based Image Retrieval (SBIR) is using free-hand sketches to retrieve images of the same category from a natural image gallery. However, SBIR requires all categories to be seen during training, which cannot be guaranteed in real-world applications. So we investigate more challenging Zero-Shot SBIR (ZS-SBIR), in which test categories do not appear in the training stage. Traditional SBIR methods are prone to be category-based retrieval and cannot generalize well from seen categories to unseen ones. In contrast, we disentangle image features into structure features and appearance features to facilitate structure-based retrieval. To assist feature disentanglement and take full advantage of disentangled information, we propose a Bi-directional Domain Translation (BDT) framework for ZS-SBIR, in which the image domain and sketch domain can be translated to each other through disentangled structure and appearance features. Finally, we perform retrieval in both structure feature space and image feature space. Extensive experiments demonstrate that our proposed approach remarkably outperforms state-of-the-art approaches by about 8% on the Sketchy dataset and over 5% on the TU-Berlin dataset.

研究の動機と目的

  • トレーニング時に未見のカテゴリがテスト段階で登場するゼロショットスケッチベース画像検索の課題に対処すること。
  • 従来のSBIR手法が未見のカテゴリに一般化できないという、カテゴリベースの検索の限界を克服すること。
  • 画像特徴を構造と外観のコンponentsに分離することで、効果的なクロスドメイン検索を可能にすること。
  • 分離された特徴を活用してスケッチと画像ドメインの間を双方向に変換するフレームワークを構築すること。
  • 統合されたフレームワーク内で構造と画像特徴空間の両方を活用することで、検索性能を向上させること。

提案手法

  • 分離モジュールを用いて画像特徴を構造と外観のコンponentsに分離する。
  • 分離された特徴を用いてスケッチと画像ドメインの間を双方向に変換するフレームワークを設計する。
  • 分離されたコンponentsから画像とスケッチを再構築するようにモデルを学習させ、ドメイン間の一貫性を強制する。
  • 構造特徴空間と画像特徴空間の両方で検索を実行することで、一般化性能を向上させる。
  • 敵対的学習とサイクル整合性損失を用いて、変換された特徴の品質とアライメントを向上させる。
  • エンドツーエンド学習により、分離と変換のコンponentsを同時に最適化する。

実験結果

リサーチクエスチョン

  • RQ1分離された構造と外観特徴は、スケッチベース画像検索におけるゼロショット一般化を改善できるか?
  • RQ2バイディレクショナルドメイントランスレーションは、未見のカテゴリのスケッチと画像ドメインを効果的にアライメントできるか?
  • RQ3ゼロショット設定において、構造ベースの検索はカテゴリベースの検索を上回る性能を示せるか?
  • RQ4分離と変換の共同最適化は、検索精度をどの程度向上させるか?
  • RQ5ベンチマークデータセットにおいて、本手法は最先端の手法と比較してどのように差をつけるか?

主な発見

  • 提案されたBDTフレームワークは、Sketchyデータセットにおいて最先端手法と比較して約8%の顕著な性能向上を達成した。
  • TU-Berlinデータセットでは、既存の手法と比較して検索性能が5%以上向上した。
  • 構造と外観特徴の分離により、ゼロショット設定における未見カテゴリへの一般化がより良好に実現された。
  • 構造特徴空間と画像特徴空間の両方で検索を行うことで、単一の空間を使用する場合よりもより強固で正確な結果が得られた。
  • バイディレクショナル変換機構により、スケッチと画像間の意味的・構造的整合性が効果的に保持された。
  • モデルは強力なゼロショット一般化性能を示し、トレーニング時に見られなかったカテゴリに対しても画像を効果的に検索できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。