Skip to main content
QUICK REVIEW

[論文レビュー] Semantic Adversarial Network for Zero-Shot Sketch-Based Image Retrieval

Xinxun Xu, Hao Wang|arXiv (Cornell University)|May 7, 2019
Advanced Image and Video Retrieval Techniques参考文献 15被引用数 4
ひとこと要約

本稿では、カテゴリレベルの単語ベクトルを用いて特徴の整合性を向上させるとともに、三重項損失を用いてクラス内判別性を保持することで、ゼロショットスケッチベース画像検索のための意味的 adversarial ネットワークを提案する。エンドツーエンドのモデルは、スケッチィーで12%以上、TU-Berlinで約3%の優れた性能を達成し、最先端の手法を上回る。

ABSTRACT

Zero-shot sketch-based image retrieval (ZS-SBIR) is a specific cross-modal retrieval task for retrieving natural images with free-hand sketches under zero-shot scenario. Previous works mostly focus on modeling the correspondence between images and sketches or synthesizing image features with sketch features. However, both of them ignore the large intra-class variance of sketches, thus resulting in unsatisfactory retrieval performance. In this paper, we propose a novel end-to-end semantic adversarial approach for ZS-SBIR. Specifically, we devise a semantic adversarial module to maximize the consistency between learned semantic features and category-level word vectors. Moreover, to preserve the discriminability of synthesized features within each training category, a triplet loss is employed for the generative module. Additionally, the proposed model is trained in an end-to-end strategy to exploit better semantic features suitable for ZS-SBIR. Extensive experiments conducted on two large-scale popular datasets demonstrate that our proposed approach remarkably outperforms state-of-the-art approaches by more than 12\% on Sketchy dataset and about 3\% on TU-Berlin dataset in the retrieval.

研究の動機と目的

  • ゼロショットスケッチベース画像検索における自由なスケッチの大きなクラス内ばらつきが検索性能を制限する問題に対処する。
  • カテゴリレベルの単語ベクトルを活用することで、スケッチと画像の特徴間の意味的整合性を向上させる。
  • 学習済みカテゴリ内の特徴合成過程で、クラス内判別性を保持する。
  • 意味的整合性と特徴判別性を同時に最適化するエンドツーエンドで学習可能なフレームワークを開発する。
  • 大規模なベンチマークデータセットにおいて、優れたゼロショット検索性能を達成する。

提案手法

  • 学習された意味的特徴とカテゴリレベルの単語ベクトルの間の整合性を最大化する意味的 adversarial モジュールを導入する。
  • 生成モジュール内で三重項損失を採用し、同じトレーニングカテゴリ内での特徴合成における判別性を維持する。
  • 意味的整合性と特徴判別性を同時に最適化するため、全モデルをエンドツーエンドで学習する。
  • 深層ニューラルネットワークを用いてスケッチと画像を共有の意味的空間にマップし、意味的整合性を強制する。
  • Word2Vec や GloVe などの単語ベクトルを監視信号として活用し、特徴を意味的カテゴリと一致させる。
  • adversarial 学習と三重項損失を組み合わせ、意味的一般化とクラス内compactさのバランスを取る。

実験結果

リサーチクエスチョン

  • RQ1意味的 adversarial 学習は、スケッチ特徴と意味的カテゴリ表現との間の整合性を向上させることができるか?
  • RQ2生成モジュールに三重項損失を組み込むことで、特徴合成時のクラス内compactさが向上するか?
  • RQ3全モデルのエンドツーエンド学習は、段階的または別個の学習に比べて、より優れたゼロショット検索性能をもたらすか?
  • RQ4従来の手法と比較して、スケッチデータに大きなクラス内ばらつきがある状況下でも、本モデルの性能はどの程度か?
  • RQ5提案手法は、標準的な ZS-SBIR ベンチマークで、最先端の手法をどの程度上回るか?

主な発見

  • 提案手法は、最先端の手法と比較して、スケッチィー・データセットで12%以上の顕著な向上を達成した。
  • TU-Berlin データセットでは、既存の手法と比較して約3%の検索性能向上を達成した。
  • 意味的 adversarial モジュールは、カテゴリレベルの単語ベクトルとの特徴整合性を効果的に向上させ、クロスモーダル整合性を改善した。
  • 三重項損失部は、特徴合成過程で各トレーニングカテゴリ内での判別的性質を効果的に保持した。
  • エンドツーエンド学習により、意味的整合性と特徴判別性の両方の最適化がより良く行われ、優れた検索精度が得られた。
  • 高いクラス内変動を伴うスケッチデータに対しても、本モデルはゼロショット条件下で強力な一般化性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。