Skip to main content
QUICK REVIEW

[论文解读] TFill: Image Completion via a Transformer-Based Architecture.

Chuanxia Zheng, Tat‐Jen Cham|arXiv (Cornell University)|Apr 2, 2021
Visual Attention and Saliency Detection被引用 13
一句话总结

TFill 提出了一种基于 Transformer 的图像补全框架,将图像补全视为序列到序列的任务,使用感受野受限的小感受野卷积神经网络(CNN)进行标记表征,从而在不偏向邻近像素的前提下显式建模长程依赖关系。该方法通过结合全局自注意力编码器与注意力感知层,提升了外观一致性并缓解了标准注意力机制的孤立效应,实现了最先进(SOTA)的性能表现。

ABSTRACT

Bridging distant context interactions is important for high quality image completion with large masks. Previous methods attempting this via deep or large receptive field (RF) convolutions cannot escape from the dominance of nearby interactions, which may be inferior. In this paper, we propose treating image completion as a directionless sequence-to-sequence prediction task, and deploy a transformer to directly capture long-range dependence in the encoder in a first phase. Crucially, we employ a restrictive CNN with small and non-overlapping RF for token representation, which allows the transformer to explicitly model the long-range context relations with equal importance in all layers, without implicitly confounding neighboring tokens when larger RFs are used. In a second phase, to improve appearance consistency between visible and generated regions, a novel attention-aware layer (AAL) is introduced to better exploit distantly related features and also avoid the insular effect of standard attention. Overall, extensive experiments demonstrate superior performance compared to state-of-the-art methods on several datasets.

研究动机与目标

  • 解决卷积神经网络在大掩码图像补全过程中建模远距离上下文交互的局限性。
  • 克服深层或大感受野卷积神经网络中邻近像素交互占主导地位的问题,后者会降低补全质量。
  • 在不依赖大感受野隐式偏置的前提下,实现对图像中所有区域的长程依赖关系的显式、等权重建模。
  • 通过新型注意力感知层,提升生成区域与可见区域之间的外观一致性。
  • 通过结合全局上下文建模与局部特征优化,实现更优的图像补全性能。

提出的方法

  • 将图像补全视为无方向的序列到序列预测任务,从而利用 Transformer 架构实现全局上下文建模。
  • 采用感受野受限的 CNN,使用小而互不重叠的感受野来表征图像标记,确保长程依赖关系不会因局部邻域主导而产生隐式偏差。
  • 在第一阶段使用标准 Transformer 编码器,通过自注意力机制在所有标记上均匀运作,捕捉整个图像中的长程依赖关系。
  • 在第二阶段引入注意力感知层(AAL),以更好地利用远距离相关特征,减少标准自注意力机制的孤立效应。
  • 将 Transformer 的全局上下文表征与 AAL 结合,以在保持与可见区域一致性的同时,优化生成区域的细节。
  • 采用两阶段训练策略:第一阶段通过 Transformer 进行全局上下文建模;第二阶段通过 AAL 实现局部优化,以提升视觉合理性。

实验结果

研究问题

  • RQ1基于 Transformer 的架构是否能在不偏向局部像素交互的前提下,有效建模图像补全中的长程依赖关系?
  • RQ2使用小感受野 CNN 进行标记表征,是否相比大感受野或深层卷积网络,能实现更均衡的远距离上下文建模?
  • RQ3注意力感知层(AAL)在多大程度上提升了生成区域与可见区域之间的外观一致性?
  • RQ4在定量与定性图像补全性能方面,该方法与最先进方法相比表现如何?
  • RQ5全局自注意力与专用优化层的结合,是否能在包含大掩码的多样化数据集上超越现有方法?

主要发现

  • TFill 在多个基准数据集上相较最先进方法实现了更优的图像补全性能。
  • 使用小而互不重叠感受野的 CNN 使 Transformer 能够对所有空间位置的长程依赖关系赋予相等的重要性。
  • 注意力感知层(AAL)显著减少了标准自注意力机制的孤立效应,使生成区域更加连贯且一致。
  • 大量实验证明,TFill 在定量指标与定性视觉质量方面均优于现有方法。
  • 该方法有效弥合了远距离上下文交互,这对大掩码下的高质量图像补全至关重要。
  • 两阶段设计——先进行全局上下文建模,再进行外观感知的优化——在全局连贯性与局部真实感之间实现了有效平衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。