[论文解读] BLT: Bidirectional Layout Transformer for Controllable Layout Generation
BLT 引入了一种双向布局变换器,通过在训练期间同时向前后方向关注属性,并在推理时迭代优化低置信度属性,实现了可控的、非自回归的布局生成。该方法在保持六种多样化布局生成基准上最先进性能的同时,推理速度相比自回归基线模型最高提升10倍,其关键在于一种新型的分层采样策略,以实现高质量结果。
Creating visual layouts is a critical step in graphic design. Automatic generation of such layouts is essential for scalable and diverse visual designs. To advance conditional layout generation, we introduce BLT, a bidirectional layout transformer. BLT differs from previous work on transformers in adopting non-autoregressive transformers. In training, BLT learns to predict the masked attributes by attending to surrounding attributes in two directions. During inference, BLT first generates a draft layout from the input and then iteratively refines it into a high-quality layout by masking out low-confident attributes. The masks generated in both training and inference are controlled by a new hierarchical sampling policy. We verify the proposed model on six benchmarks of diverse design tasks. Experimental results demonstrate two benefits compared to the state-of-the-art layout transformer models. First, our model empowers layout transformers to fulfill controllable layout generation. Second, it achieves up to 10x speedup in generating a layout at inference time than the layout transformer baseline. Code is released at https://shawnkx.github.io/blt.
研究动机与目标
- 为解决自回归布局变换器在条件布局生成中因属性依赖链不可变而导致的局限性。
- 实现灵活、用户可控的布局生成,使任何属性均可根据输入约束进行修改。
- 在保持或提升布局质量的同时,提高推理速度,相比自回归变换器更具优势。
- 开发一种分层采样策略,通过捕捉布局属性之间的结构相关性,提升非自回归布局生成质量。
- 在包括GUI、杂志、广告和家居装饰在内的多样化设计应用中对模型进行验证。
提出的方法
- BLT 采用非自回归变换器架构,在训练期间通过同时关注前后方向的邻近属性来预测被掩码的属性。
- 在推理阶段,BLT 先生成一个草稿布局,并通过分层采样策略迭代优化低置信度属性,以指导掩码选择。
- 分层采样策略将属性划分为组别(类别、大小、位置),并根据预定义顺序控制掩码生成,从而提升结构一致性。
- 该模型使用双向自注意力机制,使先前和后续属性的上下文信息共同影响预测,打破严格的自回归依赖链。
- 训练过程通过掩码特定属性组并优化重建目标实现;推理阶段则采用基于置信度的掩码选择进行迭代优化。
- 方法在六个多样化数据集上使用标准布局指标(包括IoU、重叠率、对齐度、FID和相似度)进行评估。
实验结果
研究问题
- RQ1非自回归变换器模型是否能在实现高质量布局生成的同时,支持可控的、条件化的布局编辑?
- RQ2与单向自回归模型相比,双向注意力机制是否能提升布局生成质量?
- RQ3所提出的分层采样策略在指导非自回归布局优化的掩码生成方面是否有效?
- RQ4该模型是否能在不牺牲布局质量的前提下,实现相比自回归基线模型的显著速度提升?
- RQ5该模型是否能在GUI、杂志和广告等多样化设计领域中实现良好泛化?
主要发现
- BLT 的推理速度相比自回归变换器基线模型最高提升10倍,且在密集布局中优势更明显(例如,20个对象时实现10倍加速)。
- 该模型在条件布局生成方面优于最先进自回归模型和基于VAE的模型,尤其在处理用户定义的布局属性约束方面表现更优。
- 与标准非自回归基线相比,分层采样策略显著提升性能,在RICO数据集上IoU降低0.07,重叠率降低0.10。
- 在PubLayNet数据集上,BLT将FID从非自回归基线的217降低至134,表明布局质量得到显著提升。
- 在无条件布局生成任务中,该模型保持了具有竞争力的表现,在RICO数据集上FID为70,在PubLayNet上为134,与最先进模型相当。
- 消融实验表明,分层采样顺序(如类别→大小→位置)至关重要,次优顺序会导致更高的IoU和对齐度分数。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。