Skip to main content
QUICK REVIEW

[論文レビュー] CLIPasso: Semantically-Aware Object Sketching

Yael Vinker, Ehsan Pajouheshgar|arXiv (Cornell University)|Feb 11, 2022
Advanced Vision and Imaging被引用数 10
ひとこと要約

CLIPassoは、CLIPを用いた意味的ガイダンスと微分可能ラスタライゼーションを用いて、Bézier曲線のパラメータを最適化することで、画像から意味的認識可能なスケッチを生成する最適化ベースの手法を提案する。スティック数を変化させることで、スケッチデータセットを必要とせずに複数の抽象化レベルを達成し、被写体の重要な視覚的および意味的特徴を保持する。

ABSTRACT

Abstraction is at the heart of sketching due to the simple and minimal nature of line drawings. Abstraction entails identifying the essential visual properties of an object or scene, which requires semantic understanding and prior knowledge of high-level concepts. Abstract depictions are therefore challenging for artists, and even more so for machines. We present CLIPasso, an object sketching method that can achieve different levels of abstraction, guided by geometric and semantic simplifications. While sketch generation methods often rely on explicit sketch datasets for training, we utilize the remarkable ability of CLIP (Contrastive-Language-Image-Pretraining) to distill semantic concepts from sketches and images alike. We define a sketch as a set of Bézier curves and use a differentiable rasterizer to optimize the parameters of the curves directly with respect to a CLIP-based perceptual loss. The abstraction degree is controlled by varying the number of strokes. The generated sketches demonstrate multiple levels of abstraction while maintaining recognizability, underlying structure, and essential visual components of the subject drawn.

研究の動機と目的

  • 意味的および構造的本質を捉えた、認識可能な抽象的スケッチを画像から生成する手法の開発。
  • 明示的なスケッチデータセットに依存せずに、スケッチの抽象化レベルを可変化することの実現。
  • CLIPの意味的理解力と微分可能レンダリングを活用し、スケッチパラメータのエンドツーエンド最適化を可能にすること。
  • 最小のスティック数であっても、認識可能性と構造的忠実性を維持すること。
  • スケッチコレクションで訓練された深層学習手法とは異なり、データフリーで最適化駆動の代替手法を提供すること。

提案手法

  • スケッチを学習可能な制御点を持つBézier曲線の集合として表現し、微分可能ラスタライザーを用いて最適化する。
  • 生成スケッチが入力画像の意味的コンテンツと一致するように、CLIPに基づく知覚的損失を用いる。
  • 中間的および最終的なCLIP特徴を組み合わせることで、幾何的および意味的簡略化のバランスを取る。
  • ビジョントランスフォーマーから得られるサリエンシー地図が、スティック制御点の初期化をガイドし、耐性を向上させる。
  • スティック数が抽象化レベルを制御し、スティック数が少ないほど高い抽象化が得られる。
  • エンドツーエンド微分可能であり、バックプロパゲーションを用いてスティックパラメータを直接最適化可能である。

実験結果

リサーチクエスチョン

  • RQ1深層学習ベースの手法は、専用のスケッチデータセットを必要とせずに、画像から抽象的スケッチを生成できるか。
  • RQ2CLIPの意味的理解力は、スケッチ生成における抽象化プロセスをどの程度効果的にガイドできるか。
  • RQ3極端なスティック数削減下でも、微分可能レンダリングパイプラインが意味的および構造的特徴をどの程度保持できるか。
  • RQ4サリエンシー誘導初期化は、抽象的スケッチの品質および認識可能性を向上させることができるか。
  • RQ5学習されたスケッチ表現における、抽象化レベルと認識可能性のトレードオフはいかなるものか。

主な発見

  • CLIPassoは、スティック数のみを制御パラメータとして用いることで、詳細から最小限のスケッチまで多様な抽象化レベルのスケッチを成功裏に生成した。
  • わずか8本のスティックでも、意味的および構造的整合性を維持でき、強力なカテゴリレベル認識が可能である。
  • 結果から、純粋に幾何的またはデータセット依存のアプローチに比べ、CLIPベースの損失が意味的整合性および認識可能性において優れていることが示された。
  • サリエンシー誘導初期化は収束性とスケッチ品質を向上させ、特にスティック数が少ない状況で顕著な効果を示した。
  • 動物、車両、人物の顔など多様なオブジェクトカテゴリにわたり、SketchyCOCOおよびNPRベンチマークデータセットを用いた実験で、良好な汎化性能を示した。
  • 視覚的比較から、CLIPDrawや他の最適化ベースのベースラインに比べ、高抽象化レベルでも被写体のアイデンティティをよりよく保持していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。