Skip to main content
QUICK REVIEW

[论文解读] Creative Painting with Latent Diffusion Models

Xianchao Wu|arXiv (Cornell University)|Sep 29, 2022
Generative Adversarial Networks and Image Synthesis被引用 9
一句话总结

该论文通过将维基百科的丰富上下文信息融入文本提示并基于包含81,444幅艺术作品的WikiArt数据集进行微调,增强了潜在扩散模型(LDMs)的创意绘画能力。该方法可实现对复杂现代主题的条件化生成,生成多样化的、具有特定艺术家风格的画作,显著提升了基线模型的艺术表现力与创造力。

ABSTRACT

Artistic painting has achieved significant progress during recent years. Using an autoencoder to connect the original images with compressed latent spaces and a cross attention enhanced U-Net as the backbone of diffusion, latent diffusion models (LDMs) have achieved stable and high fertility image generation. In this paper, we focus on enhancing the creative painting ability of current LDMs in two directions, textual condition extension and model retraining with Wikiart dataset. Through textual condition extension, users' input prompts are expanded with rich contextual knowledge for deeper understanding and explaining the prompts. Wikiart dataset contains 80K famous artworks drawn during recent 400 years by more than 1,000 famous artists in rich styles and genres. Through the retraining, we are able to ask these artists to draw novel and creative painting on modern topics. Direct comparisons with the original model show that the creativity and artistry are enriched.

研究动机与目标

  • 提升潜在扩散模型(LDMs)在文本到图像生成中的创意与艺术质量。
  • 解决为抽象或高层次文本提示(如“中国的城市化”或“亚洲的早晨”)生成富有表现力、富含叙事性的画作的挑战。
  • 实现条件化图像生成,使特定艺术家(例如梵高、莫奈)可被明确邀请以独特风格创作艺术作品。
  • 探索利用大规模精心筛选的艺术数据集对LDM进行再训练,以提升艺术多样性与保真度的可行性。

提出的方法

  • 利用维基百科和大规模语言模型扩展用户提供的文本提示,生成更丰富、更具描述性且上下文相关的提示。
  • 在包含81,444幅来自1,119位艺术家、涵盖27种风格和45个类别的WikiArt数据集上对潜在扩散模型进行微调。
  • 将艺术家身份、创作年份、风格和类别作为额外的条件信号,整合到U-Net主干网络的交叉注意力层中。
  • 使用预训练的自编码器将图像压缩到低维潜在空间,实现在潜在空间中的高效且高保真的扩散过程。
  • 通过扩展的文本提示和特定艺术家的条件信号引导反向扩散过程,生成图像。
  • 应用自编码器的解码器,从生成的潜在表示中重建高分辨率图像。

实验结果

研究问题

  • RQ1通过上下文和叙事细节扩展抽象文本提示,能否显著提升生成图像的艺术性与创意质量?
  • RQ2在大规模精心筛选的艺术数据集(如WikiArt)上微调预训练的LDM,能在多大程度上增强其生成多样化且风格准确画作的能力?
  • RQ3对艺术家身份、风格和类别的显式条件控制,能否在不同提示下生成一致且可识别的艺术输出?
  • RQ4扩展的提示与特定艺术家的条件控制,如何影响生成画作的情感与主题表现力?

主要发现

  • 文本条件扩展显著提升了如“中国的城市化”等高层次提示的图像质量与表现力,使模型能够生成富含叙事性的构图。
  • 在WikiArt数据集上微调后,模型能够生成著名艺术家的独特风格作品,如梵高的漩涡状天空或莫奈的印象派水景。
  • 模型成功生成同一提示在多位艺术家风格下的多样化艺术诠释,同时保留了每位艺术家特有的视觉语言。
  • 对于“青藏高原上的火车”等提示,扩展后的提示生成了更具情感共鸣与细节的输出,包括月光、传统船只等象征性元素。
  • 引入特定艺术家的条件控制可实现个性化、可定制的输出,适用于T恤设计、广告等工业应用场景。
  • 视觉对比显示,生成图像更接近手绘画作而非照片写实风格,表明具有强烈艺术风格迁移能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。