[论文解读] ASSET: Autoregressive Semantic Scene Editing with Transformers at High Resolutions
ASSET 提出一种基于 Transformer 的架构,采用稀疏化引导注意力(SGA),通过粗到细的注意力机制高效捕捉长距离依赖,实现高达 1024×1024 分辨率的语义图像编辑。该方法在计算成本仅为完整自注意力方法的几分之一的情况下,实现了逼真、多样且一致的编辑效果,在质量和效率上均优于先前的 CNN 与 Transformer 方法。
We present ASSET, a neural architecture for automatically modifying an input high-resolution image according to a user's edits on its semantic segmentation map. Our architecture is based on a transformer with a novel attention mechanism. Our key idea is to sparsify the transformer's attention matrix at high resolutions, guided by dense attention extracted at lower image resolutions. While previous attention mechanisms are computationally too expensive for handling high-resolution images or are overly constrained within specific image regions hampering long-range interactions, our novel attention mechanism is both computationally efficient and effective. Our sparsified attention mechanism is able to capture long-range interactions and context, leading to synthesizing interesting phenomena in scenes, such as reflections of landscapes onto water or flora consistent with the rest of the landscape, that were not possible to generate reliably with previous convnets and transformer approaches. We present qualitative and quantitative results, along with user studies, demonstrating the effectiveness of our method.
研究动机与目标
- 解决在高分辨率图像编辑中建模长距离依赖的挑战,同时保持计算可行性。
- 克服局部注意力机制的局限性,后者将上下文限制在邻近区域,导致编辑不一致。
- 通过基于自回归 Transformer 的框架,在 1024×1024 分辨率下实现多样、逼真且一致的图像编辑。
- 通过利用低分辨率自注意力图对注意力进行稀疏化,降低 Transformer 在高分辨率图像中的计算成本。
- 防止在基于 VQGAN 的图像编码器中,掩码区域的特征泄露到未掩码区域。
提出的方法
- 模型使用修改后的 VQGAN 编码器获取量化后的图像与语义分割表征,掩码区域由 [MASK] 标记替代。
- 高分辨率 Transformer 基于掩码图像和编辑后的语义分割图,自回归地生成图像标记。
- 稀疏化引导注意力(SGA)通过在 256×256 分辨率下运行的引导 Transformer,为每个高分辨率标记计算稀疏注意力矩阵,以识别相关图像区域。
- 引导 Transformer 在低分辨率下计算完整自注意力,其注意力图用于为高分辨率注意力选择最相关的 K 个位置,从而实现高效的长距离建模。
- 最终通过 VQGAN 解码器将生成的标记解码为图像,保持高保真输出。
- 在编码器中应用部分卷积和区域归一化,以防止掩码区域的信息泄露到未掩码区域。
实验结果
研究问题
- RQ1基于 Transformer 的架构能否在计算成本可控的前提下,有效建模高分辨率语义图像编辑中的长距离依赖?
- RQ2由低分辨率自注意力引导的稀疏注意力机制,是否能在高分辨率编辑中实现比局部或密集注意力更优的一致性与真实感?
- RQ3在 1024×1024 分辨率下,所提出的稀疏化引导注意力(SGA)机制与完整自注意力及其他稀疏注意力变体相比,在质量和效率方面表现如何?
- RQ4该模型在远距离图像区域之间,对全局场景一致性(如水面倒影或连贯的植被)的保持程度如何?
- RQ5该模型能否在高分辨率下生成多样、高质量的编辑结果,同时保持计算可行性?
主要发现
- ASSET 在 1024×1024 分辨率下实现了高质量、多样且一致的编辑效果,能够生成逼真的现象,如水面倒影和连贯的景观元素。
- 模型显著降低了计算成本:使用 SGA 训练仅需 A100 上 37GB 显存,而完整注意力则超过 40GB。
- 在 1024×1024 分辨率下,SGA 的推理速度约为完整注意力的 20 倍,同时保持了高质量输出。
- 256×256 分辨率下的引导 Transformer 仅占总推理时间的 3.4%,表明高分辨率 SGA 机制是性能提升的主要驱动力。
- ASSET 的推理速度与 TT(先前方法)相当,但用户研究与定量指标均验证其生成结果质量显著更高。
- 修改后的 VQGAN 编码器成功防止了掩码区域到未掩码区域的特征泄露,如潜在特征差异的可视化结果所示。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。