Skip to main content
QUICK REVIEW

[论文解读] CLIPDraw: Exploring Text-to-Drawing Synthesis through Language-Image Encoders

Kevin Frans, L. B. Soros|arXiv (Cornell University)|Jun 28, 2021
Handwritten Text Recognition Techniques参考文献 16被引用 93
一句话总结

CLIPDraw 通过对预训练的 CLIP 模型进行梯度下降优化,从文本合成向量笔画绘画,而无需训练新模型。

ABSTRACT

This work presents CLIPDraw, an algorithm that synthesizes novel drawings based on natural language input. CLIPDraw does not require any training; rather a pre-trained CLIP language-image encoder is used as a metric for maximizing similarity between the given description and a generated drawing. Crucially, CLIPDraw operates over vector strokes rather than pixel images, a constraint that biases drawings towards simpler human-recognizable shapes. Results compare between CLIPDraw and other synthesis-through-optimization methods, as well as highlight various interesting behaviors of CLIPDraw, such as satisfying ambiguous text in multiple ways, reliably producing drawings in diverse artistic styles, and scaling from simple to complex visual representations as stroke count is increased. Code for experimenting with the method is available at: https://colab.research.google.com/github/kvfrans/clipdraw/blob/main/clipdraw.ipynb

研究动机与目标

  • 证明一种无需训练即可从自然语言提示生成绘画的方法。
  • 检验当仅限于向量笔画表示时,基于 CLIP 的优化的行为。
  • 研究绘画风格、笔画数量和提示如何影响输出形状和可辨识性。
  • 提供一个用于探索语言–图像关系和AI辅助艺术的测试平台。

提出的方法

  • 将绘画表示为一组固定的 RGBA Bézier 曲线,具有可微渲染。
  • 使用预训练的 CLIP 模型对提示和渲染后的绘画进行编码。
  • 通过梯度下降优化曲线控制点、粗细和颜色,以使提示与图像编码之间的余弦相似度的负值最小化。
  • 对渲染图像进行随机透视偏移和裁剪的增强,以在失真下保持可辨识性。
  • 在固定步数内迭代优化,直到收敛。

实验结果

研究问题

  • RQ1与其他通过优化进行合成的方法相比,CLIPDraw 在产生可识别绘画方面表现如何?
  • RQ2提示中的风格描述如何影响绘画的视觉风格?
  • RQ3笔画数量对生成绘画的真实感和细节有何影响?
  • RQ4CLIPDraw 是否能通过提示揭示文化或抽象联想?
  • RQ5负面提示在引导 CLIPDraw 输出方面的有效性如何?

主要发现

  • CLIPDraw 使用简单的向量笔画产生多样且易于人类辨识的绘画。
  • 风格描述(“水彩”、“3D 渲染”)在同一提示下产生显著不同的艺术输出。
  • 笔画数量的增加往往产生更详细、更真实的渲染。
  • CLIPDraw 能以多种方式解读含糊提示,并且偶尔在图像中嵌入与提示相关的文本或符号。
  • 负面提示可以在一定程度上引导输出,但其效果在不同提示之间并不始终可靠。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。