Skip to main content
QUICK REVIEW

[论文解读] Colorization Transformer

M. P. Pavan Kumar, Dirk Weissenborn|arXiv (Cornell University)|Feb 8, 2021
Generative Adversarial Networks and Image Synthesis参考文献 33被引用 5
一句话总结

彩色化变换器(ColTran)提出了一种新颖的、完全基于自注意力机制的架构,用于实现高保真度、多样化的图像彩色化,采用条件变换器层和三阶段流程:首先在低分辨率下进行粗粒度自回归彩色化,随后并行进行空间和色彩超分辨率。该方法在FID指标上达到19.37的最先进性能,并在Mechanical Turk评估中,有62%的情况下优于真实图像的人工偏好。

ABSTRACT

We present the Colorization Transformer, a novel approach for diverse high fidelity image colorization based on self-attention. Given a grayscale image, the colorization proceeds in three steps. We first use a conditional autoregressive transformer to produce a low resolution coarse coloring of the grayscale image. Our architecture adopts conditional transformer layers to effectively condition grayscale input. Two subsequent fully parallel networks upsample the coarse colored low resolution image into a finely colored high resolution image. Sampling from the Colorization Transformer produces diverse colorings whose fidelity outperforms the previous state-of-the-art on colorising ImageNet based on FID results and based on a human evaluation in a Mechanical Turk test. Remarkably, in more than 60% of cases human evaluators prefer the highest rated among three generated colorings over the ground truth. The code and pre-trained checkpoints for Colorization Transformer are publicly available at https://github.com/google-research/google-research/tree/master/coltran

研究动机与目标

  • 利用深度学习解决为灰度图像生成多样化、高保真度彩色化结果的挑战。
  • 克服以往自回归模型和基于CNN模型在捕捉全局上下文信息以及生成感知上真实输出方面的局限性。
  • 开发一种基于变换器的架构,通过条件注意力机制实现在高分辨率下的高效彩色化。
  • 通过结合自回归建模与并行超分辨率,改进现有方法,实现更快、更高质量的推理。
  • 证明模型生成的彩色化结果在人类评估中可优于真实图像,表明其具备出色的感知真实感。

提出的方法

  • 采用条件轴向变换器进行粗粒度、低分辨率(64×64)的自回归彩色化,其中通过在自注意力层中引入可学习的逐像素和逐通道组件实现条件控制。
  • 引入条件变换器层,通过在变换器层中显式整合灰度输入的多个可学习组件,相比简单的输入添加方式,显著提升了条件控制的保真度。
  • 将高分辨率(256×256)彩色化分解为三个阶段:首先进行粗粒度自回归彩色化,随后通过两个并行全连接网络分别实现空间和色彩超分辨率。
  • 在轴向变换器中采用半并行采样机制,在保持高质量自回归生成的同时加速推理过程。
  • 与粗粒度彩色化模型联合训练一个辅助并行预测模型,通过改进特征学习来提升FID得分。
  • 对最终的高分辨率输出采用快速、确定性的上采样方法,实现在256×256分辨率下的高效生成。

实验结果

研究问题

  • RQ1基于自注意力机制的模型是否能在保持多样性与高保真度的前提下,实现图像彩色化任务的最先进性能?
  • RQ2在自回归彩色化中,通过变换器层中的可学习组件实现显式条件控制,与输入偏置或加性条件控制相比,其表现如何?
  • RQ3与辅助超分辨率模型联合训练在多大程度上提升了彩色化质量与FID得分?
  • RQ4仅使用轴向注意力的自回归变换器是否能高效生成高分辨率彩色化结果,而无需定制核函数或复杂注意力机制?
  • RQ5在感知真实感与视觉质量方面,人类对生成彩色化结果的偏好与真实图像相比如何?

主要发现

  • ColTran在ImageNet 256×256灰度图像上实现了19.37的新SOTA FID得分,显著优于先前方法(如PixColor的24.32和cINN的25.13)。
  • 在Mechanical Turk的2AFC测试中,模型生成的三选一最佳结果在62.0%的情况下优于真实图像,表明其具有更优的感知真实感。
  • ColTran-B(基线轴向变换器,采用输入添加方式)的FID得分为19.98,而ColTran-S(在28×28上训练)的FID得分为22.06,证明了更高分辨率自回归建模的优势。
  • 对数似然与FID之间存在中等程度的正相关性(0.57),表明更好的似然建模可带来更优的感知质量。
  • 可视化结果表明,模型在物体边界和复杂纹理区域表现出较高不确定性,证实其能够学习对模糊色彩过渡进行推理。
  • 辅助并行预测模型有助于提升FID得分,验证了其在训练过程中增强特征表示与色彩保真度的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。