[论文解读] Architext: Language-Driven Generative Architecture Design
Architext 引入了一种以语言为驱动的生成式设计系统,该系统利用微调过的大型语言模型(LLMs)仅通过自然语言提示生成有效且多样的住宅平面图。该方法实现了接近100%的布局有效性,并在最大规模的 GPT-J 模型上达到了高达83%的语义正确性,表明 LLM 可通过纯粹的语义监督有效学习建筑几何知识。
Architectural design is a highly complex practice that involves a wide diversity of disciplines, technologies, proprietary design software, expertise, and an almost infinite number of constraints, across a vast array of design tasks. Enabling intuitive, accessible, and scalable design processes is an important step towards performance-driven and sustainable design for all. To that end, we introduce Architext, a novel semantic generation assistive tool. Architext enables design generation with only natural language prompts, given to large-scale Language Models, as input. We conduct a thorough quantitative evaluation of Architext's downstream task performance, focusing on semantic accuracy and diversity for a number of pre-trained language models ranging from 120 million to 6 billion parameters. Architext models are able to learn the specific design task, generating valid residential layouts at a near 100% rate. Accuracy shows great improvement when scaling the models, with the largest model (GPT-J) yielding impressive accuracy ranging between 25% to over 80% for different prompt categories. We open source the finetuned Architext models and our synthetic dataset, hoping to inspire experimentation in this exciting area of design research.
研究动机与目标
- 开发一个灵活、开源的系统,仅通过自然语言提示实现建筑领域中的语言驱动生成式设计。
- 评估微调过的大型语言模型在无视觉输入的情况下生成有效且语义准确的住宅平面图的能力。
- 研究模型规模与架构对生成建筑布局的语义准确性和设计多样性的影响。
- 提供一个公开可用的合成数据集,包含标注的平面图以及微调过的 LLM,以推动语义生成式设计的研究。
- 探索 LLM 作为可扩展、可访问且直观的工具,在面向性能和可持续性的建筑设计工作流程中的潜力。
提出的方法
- 在包含自然语言描述空间与几何属性的合成住宅平面图数据集上,微调一系列预训练语言模型(参数规模从120M到6B不等)。
- 使用基于语义的文本化几何表示方法来表达建筑布局,以编码空间关系与房间配置。
- 通过自回归语言建模,训练模型根据输入提示生成平面图描述,以预测连续的标记输出。
- 通过将生成的文本重新转换为几何布局,并验证其结构有效性与与输入提示的语义一致性,来评估模型输出。
- 使用56种多样的自然语言提示,测试在不同设计约束和意图类别下的泛化能力。
- 利用成熟的 LLM(如 GPT-J 及其小型变体)评估性能与多样性随规模扩展的影响。
实验结果
研究问题
- RQ1微调过的大型语言模型是否能够仅通过自然语言提示生成有效且语义准确的住宅平面图?
- RQ2模型规模如何影响生成建筑布局的语义准确性和多样性?
- RQ3LLM 在无视觉输入的情况下,能在多大程度上从纯粹的语义监督中学习并泛化建筑布局规则?
- RQ4LLM 在不同类型的自然语言表达的设计约束下,性能表现有何差异?
- RQ5合成的、语义标注的数据集是否能够实现有效的零样本或少样本泛化,用于建筑布局生成?
主要发现
- 所有微调过的模型均实现了99%或以上的布局有效性率,表明其在生成结构稳固的住宅平面图方面具有高度鲁棒性。
- 最大规模的模型 GPT-J(6B 参数)在不同提示类别中的语义正确性得分介于25%至80%以上之间,最高达到83%。
- 随着模型规模的扩大,语义准确性显著提升,表明模型容量与建筑生成性能之间存在明确的相关性。
- 该系统在全部56个测试提示中成功生成了多样且有效的布局,证实了仅依赖语言生成在建筑设计中的可行性。
- 开源合成数据集与微调过的模型,使得研究结果可复现,并推动了语义生成式设计领域的进一步研究。
- 结果表明,LLM 可作为强大、可扩展且易用的设计探索生成器,尤其在与如质量多样性优化等迭代工作流集成时更具潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。