Skip to main content
QUICK REVIEW

[论文解读] AI Art in Architecture

Joern Ploennigs, Markus Berger|arXiv (Cornell University)|Dec 19, 2022
Aesthetic Perception and Analysis被引用 15
一句话总结

本文评估了基于扩散模型的AI艺术平台——Midjourney、DALL-E 2和StableDiffusion在建筑设计中的应用,分析其在构思、草图绘制和建模任务中的能力。通过结合定性案例研究与对4000万条Midjourney查询的NLP分析,作者识别出各平台的独特优势,并提出一种实用的混合工作流程,用于室内与室外设计,充分发挥各工具在输出质量与提示敏感度方面的独特优势。

ABSTRACT

Recent diffusion-based AI art platforms are able to create impressive images from simple text descriptions. This makes them powerful tools for concept design in any discipline that requires creativity in visual design tasks. This is also true for early stages of architectural design with multiple stages of ideation, sketching and modelling. In this paper, we investigate how applicable diffusion-based models already are to these tasks. We research the applicability of the platforms Midjourney, DALL-E 2 and StableDiffusion to a series of common use cases in architectural design to determine which are already solvable or might soon be. We also analyze how they are already being used by analyzing a data set of 40 million Midjourney queries with NLP methods to extract common usage patterns. With this insights we derived a workflow to interior and exterior design that combines the strengths of the individual platforms.

研究动机与目标

  • 评估当前领先的AI艺术平台——Midjourney、DALL-E 2和StableDiffusion——在建筑设计任务中的适用性。
  • 通过使用NLP技术分析4000万条公开的Midjourney查询,理解实际使用模式。
  • 识别当前可解决的建筑设计应用场景,以及未来模型改进后可能实现的应用场景。
  • 开发一种实用的、针对各平台优化的工作流程,结合各AI模型在建筑设计可视化与构思中的优势。
  • 探索当前AI模型在处理语义建筑内容(如平面图与空间布局)方面的局限性,并提出对BIM数据进行语义感知训练的需求。

提出的方法

  • 对三种领先的AI图像生成平台——Midjourney、DALL-E 2和StableDiffusion——在常见建筑设计应用场景中进行定性评估。
  • 对包含4000万条公开Midjourney查询的数据集进行NLP分析,提取常见的建筑提示词、使用模式及查询成功率。
  • 开发并测试一种混合工作流程,结合各平台的优势:Midjourney用于生成高视觉保真度的概念艺术,DALL-E 2用于实现精确的文本到图像对齐,StableDiffusion则通过修复(inpainting)与图像编辑实现精细控制。
  • 利用图像到图像生成(img2img)、修复(inpainting)与外补绘(outpainting)技术,基于初始文本提示对建筑概念进行细化与扩展。
  • 应用扩散模型原理——基于CLIP文本编码的前向与反向扩散过程——以理解模型行为与输出一致性。
  • 通过涉及平面图、立面设计与复杂空间布局的案例研究评估模型性能,识别其失效模式与局限性。

实验结果

研究问题

  • RQ1当前基于扩散模型的AI艺术平台在多大程度上能有效支持建筑设计任务?
  • RQ2用户在实际使用中如何向AI艺术平台查询建筑内容?大规模使用数据中涌现出哪些语言模式?
  • RQ3Midjourney、DALL-E 2与StableDiffusion在生成具有建筑意义的图像方面,其核心优势与局限性分别是什么?
  • RQ4AI生成的图像在多大程度上能支持建筑设计的早期构思阶段,包括草图绘制与概念建模?
  • RQ5AI生成建筑图像中的主要失效模式是什么?这些失效模式与当前模型在语义理解上的缺口有何关联?

主要发现

  • 对4000万条Midjourney查询的NLP分析显示,建筑类提示通常以风格、材料与空间描述为结构,平均需3–5轮迭代才能获得满意结果。
  • Midjourney在生成高质量、风格一致的建筑渲染图方面表现卓越,尤其适用于外部与内部概念艺术,但在精确表达语义布局方面存在困难。
  • DALL-E 2在文本提示与图像输出之间表现出更优的对齐能力,尤其在处理复杂建筑术语(如“钟楼山墙”和“弧形凸窗”)时表现突出,但偶尔会误解空间关系。
  • StableDiffusion通过修复与外补绘技术提供了最高的灵活性,特别适合对现有建筑概念进行修改或扩展。
  • 常见失效案例包括对建筑平面图的误解(如将线条视为装饰性元素而非语义实体)、对象计数错误(如将五栋建筑误认为其他数量)以及空间布局不一致。
  • 本研究证实,尽管当前AI模型可显著加速视觉构思过程,但其在建筑语义理解方面仍显不足,例如无法准确理解门连接房间或结构逻辑等概念,凸显未来模型需基于BIM数据进行语义感知训练的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。