[论文解读] Learning to Globally Edit Images with Textual Description
本文提出了一种端到端可训练的深度学习框架,用于使用自由格式的文本描述进行全局图像编辑,结合了生成对抗网络(GANs)和基于循环神经网络(RNN)的文本编码器。滤波器组模型在性能与效率之间实现了最佳平衡,而用图RNN替代RNN进一步提升了结果,这是首个实现完全基于文本驱动的全局图像编辑而无需预设规则的工作。
We show how we can globally edit images using textual instructions: given a source image and a textual instruction for the edit, generate a new image transformed under this instruction. To tackle this novel problem, we develop three different trainable models based on RNN and Generative Adversarial Network (GAN). The models (bucket, filter bank, and end-to-end) differ in how much expert knowledge is encoded, with the most general version being purely end-to-end. To train these systems, we use Amazon Mechanical Turk to collect textual descriptions for around 2000 image pairs sampled from several datasets. Experimental results evaluated on our dataset validate our approaches. In addition, given that the filter bank model is a good compromise between generality and performance, we investigate it further by replacing RNN with Graph RNN, and show that Graph RNN improves performance. To the best of our knowledge, this is the first computational photography work on global image editing that is purely based on free-form textual instructions.
研究动机与目标
- 实现无需依赖手工规则或API的、使用任意文本指令进行全局图像编辑。
- 收集大规模图像变换对及其对应自由格式文本描述的数据集以用于训练。
- 设计并比较三种可训练模型——桶模型、滤波器组模型和端到端模型,其复杂度和专家知识编码程度各不相同。
- 研究图RNN在图像编辑中作为文本编码器的有效性,相较于标准RNN有所提升。
- 证明学习到的变换可以是局部的,尽管训练数据仅包含全局编辑,表明模型具备丰富且非线性的映射能力。
提出的方法
- 系统采用条件生成对抗网络(conditional GAN)架构,具有编码器-解码器结构,其中通过RNN或图RNN对文本描述进行嵌入,并将其作为条件输入生成器以生成编辑后的图像。
- 提出三种模型:基于桶的模型(使用手工滤波器)、具有可学习滤波器的滤波器组模型,以及无先验结构的完全端到端模型。
- 滤波器组模型使用一组可训练滤波器,由文本编码器动态选择,从而实现灵活且高效的变换学习。
- 在文本编码器中应用图RNN,以建模长距离依赖关系和词语间关系,从而在模糊或长文本描述上提升性能。
- 通过亚马逊机械 Turk 收集了约 2,000 对图像-文本对的自定义数据集,涵盖亮度、对比度和色彩调整等多样化的全局编辑操作。
- 训练采用对抗损失、感知损失和L1损失,以确保生成图像的真实感与忠实度。
实验结果
研究问题
- RQ1深度学习模型能否在无需预设规则的情况下,从自由格式的文本描述中学习执行全局图像编辑?
- RQ2在质量、内存占用和训练效率方面,不同模型架构(桶模型、滤波器组模型、端到端模型)的性能表现如何比较?
- RQ3与标准RNN相比,图RNN能否在图像编辑的文本编码中实现性能提升,尤其是在长文本或模糊指令上?
- RQ4在仅用全局编辑进行训练的模型,能在多大程度上学习到局部变换?与专家标注相比表现如何?
- RQ5在真实世界中多样化文本描述上,是否可行训练一个完全端到端的系统用于图像编辑?
主要发现
- 滤波器组模型在性能与效率之间实现了最佳平衡,其内存需求仅为桶模型中K_b个桶所需内存的1/K_b。
- 图RNN在独立评分和成对评分中均优于标准GRU,独立评分分别为3.35 ± 1.24 和 3.31 ± 1.22。
- 模型学习到了复杂且非全局的映射:RGB重映射分布的输出范围比专家A更广,表明存在局部变换。
- 尽管未对滤波器函数进行显式监督,滤波器组中的每个学习滤波器均对应一种特定的编辑类型(如亮度提升或降低)。
- 系统对未见过的指令泛化能力良好,表明在真实数据上进行端到端训练可实现稳健的文本到图像编辑。
- 当文本指令较长或模糊时,模型仍能成功应用编辑,尤其得益于图RNN的结构感知能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。