Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Sketch with Shortcut Cycle Consistency

Jifei Song, Kaiyue Pang|arXiv (Cornell University)|May 1, 2018
Advanced Image and Video Retrieval Techniques参考文献 42被引用数 15
ひとこと要約

本論文は、人間のスケッチペアからのノイズが多く、弱い教師信号のもとでも頑健性を高めるためにショートカットサイクル整合性を活用する、ストローク単位のフォトからスケッチへの変換を目的とした新しい深層学習フレームワークを提案する。教師あり翻訳とドメイン内再構成、逆ドメイン再構成の両方の非教師的自己教師学習を組み合わせることで、意味的に意味のある抽象的スケッチを生成するモデルが得られ、認識およびリtrievalベンチマークにおいて最先端の手法を上回る性能を示す。また、細粒度スケッチベース画像検索(FG-SBIR)のための効果的なデータ拡張も可能である。

ABSTRACT

To see is to sketch -- free-hand sketching naturally builds ties between human and machine vision. In this paper, we present a novel approach for translating an object photo to a sketch, mimicking the human sketching process. This is an extremely challenging task because the photo and sketch domains differ significantly. Furthermore, human sketches exhibit various levels of sophistication and abstraction even when depicting the same object instance in a reference photo. This means that even if photo-sketch pairs are available, they only provide weak supervision signal to learn a translation model. Compared with existing supervised approaches that solve the problem of D(E(photo)) -> sketch, where E($\cdot$) and D($\cdot$) denote encoder and decoder respectively, we take advantage of the inverse problem (e.g., D(E(sketch)) -> photo), and combine with the unsupervised learning tasks of within-domain reconstruction, all within a multi-task learning framework. Compared with existing unsupervised approaches based on cycle consistency (i.e., D(E(D(E(photo)))) -> photo), we introduce a shortcut consistency enforced at the encoder bottleneck (e.g., D(E(photo)) -> photo) to exploit the additional self-supervision. Both qualitative and quantitative results show that the proposed model is superior to a number of state-of-the-art alternatives. We also show that the synthetic sketches can be used to train a better fine-grained sketch-based image retrieval (FG-SBIR) model, effectively alleviating the problem of sketch data scarcity.

研究の動機と目的

  • 人間のスケッチペアからの極めてノイズの多い教師信号のもとで、アブストラクトさやスタイルのばらつきが著しい状況下でもフォトからスケッチへの翻訳を学習する課題に対処すること。
  • ドメイン内再構成と逆ドメイン翻訳を通じた非教師的自己教師学習を組み合わせることで、スケッチ生成の品質を向上させること。
  • 人間のスケッチの動作を模倣するストローク単位の生成モデルを開発し、抽象的ではあるが意味的に忠実なオブジェクトの描写を生成すること。
  • 合成スケッチが、より良い細粒度スケッチベース画像検索(FG-SBIR)モデルの学習に実効的にデータ拡張として機能するかどうかを評価すること。

提案手法

  • マルチタスク学習を可能にするために、複数のタスクに共通のパラメータを持つエンコーダ・デコーダアーキテクチャを採用する。
  • 入力フォトがフォトドメインを離れることなく、エンコーダとデコーダを介して再構成されるショートカットサイクル整合性を導入する。すなわち、D(E(photo)) → photo である。
  • 本フレームワークは3つの主要なタスクを統合する:(1) 教師ありフォトからスケッチへの翻訳 D(E(photo)) → sketch、(2) 逆スケッチからフォトへの翻訳 D(E(sketch)) → photo、(3) 両ドメインにおけるドメイン内再構成。
  • 潜在空間での分離可能かつ多様なサンプリングを可能にするために、フォトエンコーダに変分オートエーコーダ型のKL損失を適用する。これにより、同じ入力から複数の異なるスケッチを生成できる。
  • 再構成、サイクル整合性、 adversarial 目的を組み合わせたマルチタスク損失を用いて、エンドツーエンドでモデルを訓練する。
  • 未学習のテストフォトから合成スケッチを生成し、それらをFG-SBIRモデルの事前学習に用いることで、下流の性能が向上した。

実験結果

リサーチクエスチョン

  • RQ1極めてばらつきの大きい人間のスケッチ教師信号のもとでも、1枚のフォトから高品質で抽象的かつ意味的に意味のあるスケッチを生成できるか?
  • RQ2同じドメイン内での入力再構成であるショートカットサイクル整合性を組み込むことで、完全なサイクル整合性と比較してスケッチ生成が向上するか?
  • RQ3本モデルが生成する合成スケッチが、細粒度スケッチベース画像検索(FG-SBIR)の性能向上に実効的にデータ拡張として機能するか?
  • RQ4認識およびリtrievalの正確性という観点から、本モデルの性能は人間のスケッチおよび最先端のモデルと比較してどうなるか?

主な発見

  • ShoeV2データセットでは、本モデルがスケッチ認識で53.50%のトップ-1精度、スケッチベース画像検索で6.00%のトップ-1精度を達成し、すべての競合手法、認識において人間のスケッチでさえも上回った。
  • より小さいChairV2データセットでは、認識で13.00%、リtrievalで8.00%のトップ-1精度を達成し、強力なCycleGAN-Sベースラインをも上回った。
  • 本モデルの性能は、ランダムの確率(ShoeV2で0.5%、ChairV2で1%)をはるかに上回っており、合成スケッチがインスタンス識別可能な詳細を保持していることが示された。
  • FG-SBIRにおけるデータ拡張に使用した場合、合成スケッチによりトップ-1精度が2.10ポイント向上(30.33%から32.43%)した。
  • 潜在空間からのサンプリングにより、同じ入力から一貫性があり多様なスケッチが生成され、同じオブジェクトの複数の妥当な解釈をモデルが生成できることを示した。
  • スケッチのストロークレベルでのレンダリング(例:靴ひもや椅子の脚)により、単なるラスタライズドコピーとは明確に異なる意味的抽象化がなされていることが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。