[論文レビュー] SketchDreamer: Interactive Text-Augmented Creative Sketch Ideation
SketchDreamerは、自然言語プロンプトに基づいて反復的にスケッチを精錬するテキスト条件付き拡散モデルと微分可能Bézierラスタライザーを組み合わせた、インタラクティブでテキスト拡張型のスケッチ生成フレームワークを提案する。非専門家がスケッチとテキストの反復的修正を通じて共同でストーリーボードを共同で作成でき、ベースラインと比較して初期スケッチとのユーザーが感じ取る一貫性が顕著に優れている。
Artificial Intelligence Generated Content (AIGC) has shown remarkable progress in generating realistic images. However, in this paper, we take a step "backward" and address AIGC for the most rudimentary visual modality of human sketches. Our objective is on the creative nature of sketches, and that creative sketching should take the form of an interactive process. We further enable text to drive the sketch ideation process, allowing creativity to be freely defined, while simultaneously tackling the challenge of "I can't sketch". We present a method to generate controlled sketches using a text-conditioned diffusion model trained on pixel representations of images. Our proposed approach, referred to as SketchDreamer, integrates a differentiable rasteriser of Bezier curves that optimises an initial input to distil abstract semantic knowledge from a pretrained diffusion model. We utilise Score Distillation Sampling to learn a sketch that aligns with a given caption, which importantly enable both text and sketch to interact with the ideation process. Our objective is to empower non-professional users to create sketches and, through a series of optimisation processes, transform a narrative into a storyboard by expanding the text prompt while making minor adjustments to the sketch input. Through this work, we hope to aspire the way we create visual content, democratise the creative process, and inspire further research in enhancing human creativity in AIGC. The code is available at \url{https://github.com/WinKawaks/SketchDreamer}.
研究の動機と目的
- 視覚的コンテンツ生成のための既存のAIGCシステムにおけるインタラクティビティと手続き的創造性の欠如に対処すること。
- 非専門家がテキストプロンプトを通じて表現的なスケッチを生成できるようにすることで、スケッチができないという障壁を克服し、スケッチ作成を民主化すること。
- テキストとスケッチの両方の入力を共同でガイドとして用いるインタラクティブで反復的なプロセスとしてスケッチ作成をモデル化すること。
- 初期スケッチへの忠実性を維持しつつ、プロンプトの進化に伴い意味的拡張を可能にする手法を開発すること。
- テキストとスケッチのモダリティが創造的で手続き的な生成パイプライン内でどのように共進化するかを調査すること。
提案手法
- ピクセル表現の画像を学習データとして用い、テキストと初期スケッチの両方の入力を条件として、スケッチに似た出力を生成するテキスト条件付き拡散モデルを訓練する。
- Bézier曲線の微分可能ラスタライザーにより、スケッチのストロークパラメータを最適化し、テキストプロンプトに一致させる。
- スコア蒸留サンプリング(SDS)を用いて、生成スケッチのCLIP埋め込みとテキストキャプションのCLIP埋め込みとの距離を最小化することでスケッチを最適化する。
- 反復的精錬をサポート:ユーザーはテキストプロンプトを拡張し、スケッチを微調整(例:リサイズ、位置移動、ストローク追加)することで、各ステップで更新されたスケッチを生成する。
- 初期スケッチは非プロフェッショナルの描画品質を反映するためQuickDrawから取得され、モデルは精錬過程でも意味的・構造的忠実性を維持するように訓練されている。
- 知覚的一致性を評価するためのユーザースタディを実施し、3つの生成オプションの中から初期入力に最も類似していると感じたスケッチを選択してもらう。

実験結果
リサーチクエスチョン
- RQ1テキスト条件付き拡散モデルは、進化するテキストプロンプトに従いながらも初期スケッチへの忠実性を維持したスケッチを生成できるか?
- RQ2テキストとスケッチの両方の入力を反復的に精錬することで、生成スケッチの知覚的一致性と創造性にどのような影響を与えるか?
- RQ3微分可能Bézierラスタライザーは、テキストと初期スケッチの入力から、制御可能で高精度なスケッチ生成をどの程度可能にするか?
- RQ4本手法は、テキストに従った生成において初期スケッチの構造をどの程度保持しているか?ベースライン手法と比較してどうか?
- RQ5非専門家ユーザーは、自然言語と最小限のスケッチ編集を通じて、本システムを効果的に使いこなしてストーリーボードを共同で作成できるか?
主な発見
- ユーザースタディでは、SketchDreamerの好み選択率が68.34%に達し、初期スケッチに最も類似したスケッチを選んだ割合として、VectorFusion(init)の22.91%およびVectorFusionの8.75%を顕著に上回った。
- 本手法はR-Precスコア72.94%およびCLIP類似度スコア31.50を達成し、テキストプロンプトに強く適合しつつも初期スケッチの構造的忠実性を維持していることを示している。
- 初期スケッチの品質が低く(QuickDrawのR-Precが28.91%)、もともと粗いにもかかわらず、SketchDreamerは一貫性を顕著に向上させ、劣悪な入力に対しても頑健であることを示した。
- 制御不能な手法およびベースラインの制御可能手法よりも、知覚的一致性で優れた性能を示しており、最適化プロセスにおけるテキストとスケッチの有効な統合を裏付けている。
- ユーザースタディの結果から、テキストとスケッチの両方の編集による反復的精錬が、テキストのみまたは非インタラクティブな手法よりも一貫性の高いストーリーボード生成を実現していることが確認された。
- 本アプローチは、自然言語と最小限の手動入力により表現的なスケッチを生成できるため、「スケッチができない」という問題を効果的に解決している。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。