Skip to main content
QUICK REVIEW

[论文解读] Diverse Image Inpainting with Bidirectional and Autoregressive Transformers

Yingchen Yu, Fangneng Zhan|arXiv (Cornell University)|Apr 26, 2021
Generative Adversarial Networks and Image Synthesis参考文献 61被引用 15
一句话总结

本文提出 BAT-Fill,一种新颖的图像修复框架,采用双向自回归 Transformer(BAT)建模长距离依赖与双向上下文,实现多样化、高保真度的图像生成。通过在置换序列中结合自回归建模与掩码语言建模(MLM),BAT 实现了缺失图像区域的一致且多样的补全,在 CelebA-HQ、Places2 和 Paris StreetView 数据集上,其在保真度与多样性方面均优于最先进方法。

ABSTRACT

Image inpainting is an underdetermined inverse problem, which naturally allows diverse contents to fill up the missing or corrupted regions realistically. Prevalent approaches using convolutional neural networks (CNNs) can synthesize visually pleasant contents, but CNNs suffer from limited perception fields for capturing global features. With image-level attention, transformers enable to model long-range dependencies and generate diverse contents with autoregressive modeling of pixel-sequence distributions. However, the unidirectional attention in autoregressive transformers is suboptimal as corrupted image regions may have arbitrary shapes with contexts from any direction. We propose BAT-Fill, an innovative image inpainting framework that introduces a novel bidirectional autoregressive transformer (BAT) for image inpainting. BAT utilizes the transformers to learn autoregressive distributions, which naturally allows the diverse generation of missing contents. In addition, it incorporates the masked language model like BERT, which enables bidirectionally modeling of contextual information of missing regions for better image completion. Extensive experiments over multiple datasets show that BAT-Fill achieves superior diversity and fidelity in image inpainting qualitatively and quantitatively.

研究动机与目标

  • 为解决在存在大面积不规则缺失区域时,生成多样化且逼真图像补全的挑战。
  • 克服自回归 Transformer 中单向注意力机制的局限性,以及基于 MLM 模型在图像修复中独立预测的缺陷。
  • 通过整合双向上下文与输出依赖性,提升图像修复中的全局上下文建模与结构一致性。
  • 提出一种两阶段框架,首先通过 BAT 生成连贯结构,随后利用基于 CNN 的生成器细化纹理。

提出的方法

  • 提出一种双向自回归 Transformer(BAT),通过置换输入序列,使模型能够同时建模缺失像素的过去与未来上下文。
  • 采用两阶段训练流程:首先,BAT 通过自回归建模生成多样化且连贯的图像结构;其次,基于 CNN 的纹理生成器利用高频细节对结果进行精细化处理。
  • 应用类似 BERT 的掩码语言建模(MLM)方法,利用双向上下文重建缺失标记,提升上下文感知能力。
  • 采用序列置换策略,对有效像素与缺失像素进行排序,使自回归生成可从首个缺失标记开始,同时依赖全部可用上下文。
  • 整合自回归建模以强制输出依赖性,确保预测标记之间的连贯性。
  • 采用重建损失与对抗性损失联合训练模型,以增强生成结果的真实感与结构保真度。

实验结果

研究问题

  • RQ1基于 Transformer 的架构若结合双向上下文建模与自回归生成,是否能比单向自回归模型产生更多样化且一致的图像修复结果?
  • RQ2将掩码语言建模(MLM)与自回归建模相结合,如何提升图像修复的质量与多样性?
  • RQ3所提出的 BAT-Fill 框架在图像保真度与结构多样性方面,相较于现有最先进方法,其性能提升程度如何?
  • RQ4两阶段设计(先生成结构,再细化纹理)是否相比端到端方法能显著提升整体修复质量?

主要发现

  • BAT-Fill 在 CelebA-HQ、Places2 与 Paris StreetView 上均达到最先进性能,其中在 Paris StreetView 上,20-40% 掩码下 FID 得分为 48.19,40-60% 掩码下为 64.20,随机掩码下为 48.19,优于所有确定性与多样化方法。
  • 消融实验表明,BAT 显著提升重建质量(FID: 40.91),同时保持高多样性(LPIPS: 0.0301),优于缺乏双向上下文(FID: 59.60)或自回归建模(FID: 49.62)的模型。
  • 在 Paris StreetView 上,20-40% 掩码下,PSNR 达到 26.52,SSIM 达到 0.864,表明在保持多样性的同时具备出色的保真度。
  • LPIPS 得分分别为 0.076(20-40%)、0.147(40-60%)与 0.106(随机掩码),表明 BAT-Fill 生成的图像在感知上比 PIC(一种强基准的多样化修复方法)更具多样性。
  • 两阶段设计在纹理合成方面表现更优,表现为更低的 ℓ₁ 损失(2.70%)与更高的 PSNR(26.52),优于 PIC(ℓ₁: 3.43%,PSNR: 24.80)。
  • 消融实验表明,若移除自回归建模,FID 降低至 49.62,但多样性也下降(LPIPS: 0.0304);若移除双向上下文,FID 急剧上升至 59.60,证实了两个组件的关键作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。