Skip to main content
QUICK REVIEW

[论文解读] Bridging Global Context Interactions for High-Fidelity Image Completion

Chuanxia Zheng, Tat‐Jen Cham|arXiv (Cornell University)|Apr 2, 2021
Generative Adversarial Networks and Image Synthesis参考文献 54被引用 4
一句话总结

本文提出 TFill,一种基于 Transformer 的图像补全方法,将图像补全视为序列到序列的任务,以显式建模长距离全局上下文,避免局部偏差。通过使用感受野小、非重叠的限制性 CNN 进行标记表示,模型确保对远距离可见区域给予同等关注,同时引入注意力感知层(AAL)以提升外观一致性,在多个基准测试中实现最先进性能,FID 和 LPIPS 分数更低。

ABSTRACT

Bridging global context interactions correctly is important for high-fidelity image completion with large masks. Previous methods attempting this via deep or large receptive field (RF) convolutions cannot escape from the dominance of nearby interactions, which may be inferior. In this paper, we propose to treat image completion as a directionless sequence-to-sequence prediction task, and deploy a transformer to directly capture long-range dependence in the encoder. Crucially, we employ a restrictive CNN with small and non-overlapping RF for weighted token representation, which allows the transformer to explicitly model the long-range visible context relations with equal importance in all layers, without implicitly confounding neighboring tokens when larger RFs are used. To improve appearance consistency between visible and generated regions, a novel attention-aware layer (AAL) is introduced to better exploit distantly related high-frequency features. Overall, extensive experiments demonstrate superior performance compared to state-of-the-art methods on several datasets.

研究动机与目标

  • 解决在大而不规则掩码下进行高保真图像补全时的长距离上下文建模挑战。
  • 克服深度卷积网络中倾向于关注邻近区域而非远距离可见区域的局部偏差问题。
  • 在 Transformer 编码器中显式地对所有可见标记进行等权重的全局依赖建模。
  • 通过自适应特征选择,提升生成区域与可见区域之间的外观一致性。
  • 设计一种灵活的全卷积框架,可扩展至任意图像分辨率。

提出的方法

  • 将图像补全视为无方向的序列到序列预测任务,使用 Transformer 编码器。
  • 采用感受野小、非重叠的限制性 CNN 生成标记表示,将可见上下文与局部相关性分离。
  • 在 Transformer 中使用自注意力机制,对所有可见标记的长距离依赖关系进行等权重建模,避免邻近区域主导。
  • 引入注意力感知层(AAL),根据注意力分数动态选择高频特征,提升外观一致性。
  • 采用两阶段细化框架:首先通过 TFill-Coarse 进行粗粒度内容生成,随后利用 AAL 进行外观细化。
  • 采用全卷积设计,支持任意图像尺寸的推理,克服标准位置嵌入带来的固定序列长度限制。

实验结果

研究问题

  • RQ1基于 Transformer 的架构是否能有效建模图像补全中的长距离全局上下文,而不会偏向局部特征?
  • RQ2限制标记编码器的感受野对图像补全中全局依赖关系建模有何影响?
  • RQ3注意力感知层是否能通过自适应地从可见区域和生成区域中选择特征,改善外观一致性?
  • RQ4与现有两阶段方法相比,该方法在不同掩码类型下的保真度与泛化能力如何?
  • RQ5该模型是否能在保持性能与效率的前提下,扩展至高分辨率图像?

主要发现

  • TFill 在多个数据集上实现最先进性能,相比先前方法,平均 FID 降低 2.8%,LPIPS 降低 6.0%。
  • 限制性 CNN 标记化在使用 16×16 感受野时,将 FID 降低至 3.63,LPIPS 降低至 0.057,优于更大的感受野。
  • AAL 模块相比次优基线,使 FID 降低 0.11,LPIPS 降低 0.004,证明其显著提升了外观一致性。
  • 在 FFHQ 数据集上,TFill-AAL 在随机掩码下实现 LPIPS 0.0412 和 FID 2.57,优于 SA、CA 和 SLTA。
  • 即使在大感受野下,模型仍保持低内存占用(1.15 GB)和快速推理时间(0.180 秒),展现出高效性。
  • 定性结果表明,生成区域无任何伪影,而 CA 和 PIC 等方法会产生颜色不一致的输出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。