Skip to main content
QUICK REVIEW

[论文解读] CLIPasso: Semantically-Aware Object Sketching

Yael Vinker, Ehsan Pajouheshgar|arXiv (Cornell University)|Feb 11, 2022
Advanced Vision and Imaging被引用 10
一句话总结

CLIPasso 提出了一种基于优化的方法,用于语义感知的物体素描绘制,该方法利用 CLIP 进行语义引导,并通过可微分光栅化技术优化贝塞尔曲线参数,从图像生成抽象且可识别的素描。通过调整线条数量,该方法可在无需素描数据集的情况下实现多种抽象层次,同时保留对象的关键视觉与语义特征。

ABSTRACT

Abstraction is at the heart of sketching due to the simple and minimal nature of line drawings. Abstraction entails identifying the essential visual properties of an object or scene, which requires semantic understanding and prior knowledge of high-level concepts. Abstract depictions are therefore challenging for artists, and even more so for machines. We present CLIPasso, an object sketching method that can achieve different levels of abstraction, guided by geometric and semantic simplifications. While sketch generation methods often rely on explicit sketch datasets for training, we utilize the remarkable ability of CLIP (Contrastive-Language-Image-Pretraining) to distill semantic concepts from sketches and images alike. We define a sketch as a set of Bézier curves and use a differentiable rasterizer to optimize the parameters of the curves directly with respect to a CLIP-based perceptual loss. The abstraction degree is controlled by varying the number of strokes. The generated sketches demonstrate multiple levels of abstraction while maintaining recognizability, underlying structure, and essential visual components of the subject drawn.

研究动机与目标

  • 开发一种从图像生成抽象且可识别素描的方法,以捕捉语义和结构本质。
  • 在不依赖显式素描数据集的情况下,实现素描绘制中的可变抽象层次。
  • 利用 CLIP 的语义理解能力与可微分渲染技术,对素描参数进行端到端优化。
  • 即使在最少线条数量下,仍保持可识别性与结构保真度。
  • 为基于深度学习的方法提供一种无需数据、基于优化的替代方案,避免依赖于素描集合的训练。

提出的方法

  • 该方法将素描表示为具有可学习控制点的贝塞尔曲线集合,并通过可微分光栅化器进行优化。
  • 采用基于 CLIP 的感知损失,以使生成的素描与输入图像的语义内容对齐。
  • 结合中间层与最终层的 CLIP 特征,以平衡几何简化与语义简化。
  • 利用视觉变压器生成的显著性图,指导线条控制点的初始化,以提升鲁棒性。
  • 线条数量控制抽象层次,线条越少,抽象程度越高。
  • 该方法为端到端可微分结构,支持通过反向传播直接优化线条参数。

实验结果

研究问题

  • RQ1基于深度学习的方法是否能在无需专用素描数据集的情况下,从图像生成抽象素描?
  • RQ2CLIP 的语义理解能力在多大程度上能引导素描生成过程中的抽象化?
  • RQ3在极端减少线条数量的情况下,可微分渲染流水线在多大程度上能保留语义与结构特征?
  • RQ4基于显著性图的初始化是否能提升抽象素描的质量与可识别性?
  • RQ5在学习到的素描表征中,抽象层次与可识别性之间的权衡关系如何?

主要发现

  • CLIPasso 仅通过线条数量作为控制参数,成功生成从高度详细到极简的多种抽象层次素描。
  • 即使仅使用 8 根线条,该方法仍能保持语义与结构完整性,实现强类别级别的识别能力。
  • 实验结果表明,基于 CLIP 的损失在语义一致性和可识别性方面优于纯几何或依赖数据集的方法。
  • 基于显著性图的初始化显著提升了收敛速度与素描质量,尤其在低线条数量条件下表现更优。
  • 该方法在多种物体类别上表现出良好的泛化能力,包括动物、车辆和人脸,已在 SketchyCOCO 与 NPR 基准数据集上得到验证。
  • 视觉对比显示,在高抽象层次下,CLIPasso 在保持主体身份方面优于 CLIPDraw 及其他基于优化的基线方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。