Skip to main content
QUICK REVIEW

[论文解读] Visual Prompt Tuning for Generative Transfer Learning

Kihyuk Sohn, Hao Yuan|arXiv (Cornell University)|Oct 3, 2022
Generative Adversarial Networks and Image Synthesis被引用 11
一句话总结

本文提出视觉提示微调(Visual Prompt Tuning)用于视觉变换器的生成式迁移学习,其中可学习的视觉提示被附加到图像标记序列之前,以将预训练的生成模型适配到新领域。该方法在极少微调的情况下,于多样化视觉领域中实现了最先进水平的图像生成质量,显著优于先前方法在零样本和少样本设置下的表现。

ABSTRACT

Transferring knowledge from an image synthesis model trained on a large dataset is a promising direction for learning generative image models from various domains efficiently. While previous works have studied GAN models, we present a recipe for learning vision transformers by generative knowledge transfer. We base our framework on state-of-the-art generative vision transformers that represent an image as a sequence of visual tokens to the autoregressive or non-autoregressive transformers. To adapt to a new domain, we employ prompt tuning, which prepends learnable tokens called prompt to the image token sequence, and introduce a new prompt design for our task. We study on a variety of visual domains, including visual task adaptation benchmark~\cite{zhai2019large}, with varying amount of training images, and show effectiveness of knowledge transfer and a significantly better image generation quality over existing works.

研究动机与目标

  • 实现从预训练的生成式视觉变换器到新视觉领域的高效知识迁移,尤其在数据有限的情况下。
  • 通过引入参数高效的适应机制,解决大规模生成模型微调的挑战。
  • 通过基于提示的适应方法,提升少样本和零样本设置下的图像生成质量。
  • 开发一种专为自回归与非自回归视觉变换器设计的新提示结构。

提出的方法

  • 该框架采用可学习的视觉标记,称为‘提示’,将其附加到图像视觉标记序列之前。
  • 在微调过程中优化提示,同时保持底层视觉变换器权重冻结,从而实现参数高效的适应。
  • 该方法被应用于自回归与非自回归视觉变换器架构,以实现图像生成。
  • 提出一种新型提示设计,以增强下游领域的特征表示与生成质量。
  • 在不同训练数据量下的视觉任务适应基准上对方法进行评估。
  • 模型通过标准生成目标端到端训练,仅将提示作为可训练参数。

实验结果

研究问题

  • RQ1视觉提示微调能否在数据有限的情况下,有效适配预训练的视觉变换器到新视觉领域?
  • RQ2与全量微调相比,提示微调在生成质量与参数效率方面表现如何?
  • RQ3提示设计对视觉变换器中生成式迁移学习性能有何影响?
  • RQ4该方法是否能在数据量各异的多样化视觉领域中实现泛化?
  • RQ5提示微调能否在少样本和零样本图像生成设置中达到最先进水平?

主要发现

  • 所提方法在多个视觉领域上的视觉任务适应基准中,实现了最先进水平的图像生成质量。
  • 视觉提示微调在少样本和零样本设置下,显著优于现有方法。
  • 即使每个领域仅使用100张训练图像,该方法仍能保持高水平的生成质量。
  • 该方法展现出强大的参数效率,仅需微调提示标记,而保持视觉变换器权重冻结。
  • 新型提示设计相比基线提示方法,能生成更连贯且更具多样性的图像。
  • 该框架在包括自然图像、草图和医学影像在内的多样化视觉领域中,均表现出有效的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。