[论文解读] Visual Prompt Tuning for Generative Transfer Learning
本文提出视觉提示微调(Visual Prompt Tuning)用于视觉变换器的生成式迁移学习,其中可学习的视觉提示被附加到图像标记序列之前,以将预训练的生成模型适配到新领域。该方法在极少微调的情况下,于多样化视觉领域中实现了最先进水平的图像生成质量,显著优于先前方法在零样本和少样本设置下的表现。
Transferring knowledge from an image synthesis model trained on a large dataset is a promising direction for learning generative image models from various domains efficiently. While previous works have studied GAN models, we present a recipe for learning vision transformers by generative knowledge transfer. We base our framework on state-of-the-art generative vision transformers that represent an image as a sequence of visual tokens to the autoregressive or non-autoregressive transformers. To adapt to a new domain, we employ prompt tuning, which prepends learnable tokens called prompt to the image token sequence, and introduce a new prompt design for our task. We study on a variety of visual domains, including visual task adaptation benchmark~\cite{zhai2019large}, with varying amount of training images, and show effectiveness of knowledge transfer and a significantly better image generation quality over existing works.
研究动机与目标
- 实现从预训练的生成式视觉变换器到新视觉领域的高效知识迁移,尤其在数据有限的情况下。
- 通过引入参数高效的适应机制,解决大规模生成模型微调的挑战。
- 通过基于提示的适应方法,提升少样本和零样本设置下的图像生成质量。
- 开发一种专为自回归与非自回归视觉变换器设计的新提示结构。
提出的方法
- 该框架采用可学习的视觉标记,称为‘提示’,将其附加到图像视觉标记序列之前。
- 在微调过程中优化提示,同时保持底层视觉变换器权重冻结,从而实现参数高效的适应。
- 该方法被应用于自回归与非自回归视觉变换器架构,以实现图像生成。
- 提出一种新型提示设计,以增强下游领域的特征表示与生成质量。
- 在不同训练数据量下的视觉任务适应基准上对方法进行评估。
- 模型通过标准生成目标端到端训练,仅将提示作为可训练参数。
实验结果
研究问题
- RQ1视觉提示微调能否在数据有限的情况下,有效适配预训练的视觉变换器到新视觉领域?
- RQ2与全量微调相比,提示微调在生成质量与参数效率方面表现如何?
- RQ3提示设计对视觉变换器中生成式迁移学习性能有何影响?
- RQ4该方法是否能在数据量各异的多样化视觉领域中实现泛化?
- RQ5提示微调能否在少样本和零样本图像生成设置中达到最先进水平?
主要发现
- 所提方法在多个视觉领域上的视觉任务适应基准中,实现了最先进水平的图像生成质量。
- 视觉提示微调在少样本和零样本设置下,显著优于现有方法。
- 即使每个领域仅使用100张训练图像,该方法仍能保持高水平的生成质量。
- 该方法展现出强大的参数效率,仅需微调提示标记,而保持视觉变换器权重冻结。
- 新型提示设计相比基线提示方法,能生成更连贯且更具多样性的图像。
- 该框架在包括自然图像、草图和医学影像在内的多样化视觉领域中,均表现出有效的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。