Skip to main content
QUICK REVIEW

[论文解读] SketchDreamer: Interactive Text-Augmented Creative Sketch Ideation

Zhiyu Qu, Tao Xiang|arXiv (Cornell University)|Aug 27, 2023
Multimodal Machine Learning Applications被引用 4
一句话总结

SketchDreamer 提出了一种交互式、文本增强的草图生成框架,采用基于文本条件的扩散模型与可微分贝塞尔栅格化器,根据自然语言提示迭代优化草图。该方法使非专业人士能够通过可控的、迭代的草图与文本修改共同创作分镜稿,与基线方法相比,在保持初始草图一致性方面获得了更高的用户感知质量。

ABSTRACT

Artificial Intelligence Generated Content (AIGC) has shown remarkable progress in generating realistic images. However, in this paper, we take a step "backward" and address AIGC for the most rudimentary visual modality of human sketches. Our objective is on the creative nature of sketches, and that creative sketching should take the form of an interactive process. We further enable text to drive the sketch ideation process, allowing creativity to be freely defined, while simultaneously tackling the challenge of "I can't sketch". We present a method to generate controlled sketches using a text-conditioned diffusion model trained on pixel representations of images. Our proposed approach, referred to as SketchDreamer, integrates a differentiable rasteriser of Bezier curves that optimises an initial input to distil abstract semantic knowledge from a pretrained diffusion model. We utilise Score Distillation Sampling to learn a sketch that aligns with a given caption, which importantly enable both text and sketch to interact with the ideation process. Our objective is to empower non-professional users to create sketches and, through a series of optimisation processes, transform a narrative into a storyboard by expanding the text prompt while making minor adjustments to the sketch input. Through this work, we hope to aspire the way we create visual content, democratise the creative process, and inspire further research in enhancing human creativity in AIGC. The code is available at \url{https://github.com/WinKawaks/SketchDreamer}.

研究动机与目标

  • 解决现有 AIGC 系统在视觉内容生成中缺乏交互性与程序化创造力的问题。
  • 通过使非专业人士能够借助文本提示生成富有表现力的草图,突破‘我画不出’的障碍,实现草图创作的民主化。
  • 将草图创作建模为一种交互式、迭代的过程,其中文本与草图输入共同引导构思。
  • 开发一种在保持初始草图忠实度的同时,通过提示演化实现语义扩展的方法。
  • 探索在创意性、程序化生成流程中,文本与草图模态如何协同演化。

提出的方法

  • 在图像像素表示上训练一个文本条件扩散模型,以生成受文本和初始草图输入共同条件控制的草图类输出。
  • 使用可微分的贝塞尔曲线栅格化器,实现对笔画参数的端到端优化,使其与文本提示对齐。
  • 采用评分蒸馏采样(Score Distillation Sampling, SDS)方法,通过最小化生成草图的 CLIP 嵌入与文本描述的 CLIP 嵌入之间的距离,来优化草图。
  • 该方法支持迭代优化:用户可扩展文本提示并进行小幅草图修改(如调整大小、移动位置、添加笔画),模型在每一步生成更新后的草图。
  • 初始草图来源于 QuickDraw,以体现非专业人士的绘画质量,且模型在优化过程中被训练以保持语义与结构的一致性。
  • 通过用户研究评估感知一致性,参与者需从三组生成选项中选择与初始输入最相似的草图。
(a) Generation by single round.
(a) Generation by single round.

实验结果

研究问题

  • RQ1文本条件扩散模型能否在演化文本提示的引导下,生成既保持与初始草图一致又具备语义引导性的草图?
  • RQ2对文本与草图输入进行交互式、迭代式优化,如何影响生成草图的感知一致性和创造力?
  • RQ3可微分贝塞尔栅格化器在多大程度上能实现从文本与初始草图输入出发的可控、高保真草图生成?
  • RQ4在文本引导生成过程中,所提方法与基线方法相比,在保留初始草图结构方面表现如何?
  • RQ5非专业人士用户能否有效利用该系统,通过自然语言与最少的草图编辑共同创作分镜稿?

主要发现

  • SketchDreamer 在用户研究中的偏好得票率达到 68.34%,显著高于 VectorFusion (init) 的 22.91% 与 VectorFusion 的 8.75%,在选择与初始输入最一致的草图方面表现更优。
  • 该方法在 R-Prec 指标上达到 72.94%,CLIP 相似度得分为 31.50,表明其在保持与文本提示高度对齐的同时,有效保留了初始草图的结构。
  • 尽管初始草图质量较低(QuickDraw 的 R-Prec 为 28.91%),SketchDreamer 仍显著提升了一致性,证明其对低质量输入具有鲁棒性。
  • 该方法在感知一致性方面优于不可控与基线可控方法,表明在优化过程中实现了文本与草图的有效融合。
  • 用户研究结果证实,结合文本与草图编辑的迭代优化,能生成比仅使用文本或非交互式方法更连贯、更一致的分镜稿。
  • 该方法有效解决了‘我画不出’的问题,使用户能够通过自然语言与最少的手动输入生成富有表现力的草图。
(b) Interactive generation by multiple rounds.
(b) Interactive generation by multiple rounds.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。