[论文解读] Encoder-based Domain Tuning for Fast Personalization of Text-to-Image Models
本文提出一种基于编码器的领域微调方法,仅需五步训练即可在11秒内完成文本到图像扩散模型的一次性个性化。通过在大规模领域特定数据集上联合训练概念编码器与正则化权重偏移量,该方法实现了快速、高保真度的个性化,同时保持身份一致性并降低存储成本。
Text-to-image personalization aims to teach a pre-trained diffusion model to reason about novel, user provided concepts, embedding them into new scenes guided by natural language prompts. However, current personalization approaches struggle with lengthy training times, high storage requirements or loss of identity. To overcome these limitations, we propose an encoder-based domain-tuning approach. Our key insight is that by underfitting on a large set of concepts from a given domain, we can improve generalization and create a model that is more amenable to quickly adding novel concepts from the same domain. Specifically, we employ two components: First, an encoder that takes as an input a single image of a target concept from a given domain, e.g. a specific face, and learns to map it into a word-embedding representing the concept. Second, a set of regularized weight-offsets for the text-to-image model that learn how to effectively ingest additional concepts. Together, these components are used to guide the learning of unseen concepts, allowing us to personalize a model using only a single image and as few as 5 training steps - accelerating personalization from dozens of minutes to seconds, while preserving quality.
研究动机与目标
- 解决现有文本到图像个性化方法计算和存储成本高昂的问题,这些方法需要长时间微调和多张图像。
- 通过学习新概念的泛化性、领域感知初始化,克服身份崩溃和对背景细节的过拟合。
- 仅使用单张图像和最少的训练步骤,实现对同一领域新概念的快速个性化。
- 提出一种联合学习框架,结合迭代式编码器与可学习权重偏移量,以提升泛化能力和可编辑性。
- 实现在推理阶段的个性化,无需为每个新身份单独保存模型检查点,从而降低部署开销。
提出的方法
- 训练一个专用的编码器网络,通过去噪步骤中的迭代优化,将目标概念的单张输入图像映射为词嵌入表示。
- 采用基于HyperNetwork的方法,学习文本到图像模型注意力投影矩阵的低秩、正则化权重偏移量,而非微调整个模型。
- 在大规模领域特定数据集(如人脸的FFHQ、LSUN猫)上联合预训练编码器与权重偏移量,以建立强领域感知初始化。
- 在推理阶段,仅使用单张新概念图像和单张A100 GPU上的五步训练,微调编码器与权重偏移量。
- 利用迭代编码器在每一步去噪过程中观察去噪过程,实现动态修正,提升与目标概念的对齐性。
- 通过HyperNetwork施加平滑性先验,约束偏移空间,防止对虚假图像细节的过拟合。
实验结果
研究问题
- RQ1单图像个性化方法能否在极短训练时间和极低存储成本下实现高保真结果?
- RQ2如何对预训练模型进行初始化,使其在不发生过拟合的情况下泛化到同一领域中未见的概念?
- RQ3在扩散过程中,迭代编码器优化在多大程度上能提升嵌入质量与概念一致性?
- RQ4编码器与权重偏移量的联合预训练能否实现在不重训练整个模型的前提下,实现快速推理时的个性化?
- RQ5当在某一领域(如人脸)上训练的模型应用于领域外概念(如木制玩具)时,其领域泛化能力的极限是什么?
主要发现
- 该方法将个性化时间从数十分钟缩短至单张A100 GPU上的11秒,相比先前方法提速60倍至140倍。
- 仅通过五步训练和单张图像,模型即可在各种提示下生成高保真、身份保持一致的图像。
- 迭代编码器在整个去噪过程中保持嵌入更贴近真实世界领域,减少过拟合并提升可编辑性。
- 该方法在领域内泛化良好:使用猫模型训练的模型对狗进行个性化也能获得高质量结果,但对远距离领域性能下降。
- 当使用人脸或猫模型对木制玩具等领域外概念进行个性化时,方法完全失效,表明存在领域特定限制。
- 由于联合预训练提供的强先验,即使在单张图像上微调,该方法也能保持模型质量并避免身份崩溃。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。