[论文解读] Key-Locked Rank One Editing for Text-to-Image Personalization
Perfusion 提出了一种关键锁存的秩-1编辑方法,用于文本到图像的个性化生成,仅需每概念 100KB 的参数量,即可实现高视觉保真度和强文本对齐效果。通过将概念键锁定至其上位类别嵌入,并对值投影应用门控秩-1更新,该方法实现了对概念影响的运行时控制,支持多概念组合,并在不重新训练的情况下覆盖保真度-对齐度权衡的帕累托前沿。
Text-to-image models (T2I) offer a new level of flexibility by allowing users to guide the creative process through natural language. However, personalizing these models to align with user-provided visual concepts remains a challenging problem. The task of T2I personalization poses multiple hard challenges, such as maintaining high visual fidelity while allowing creative control, combining multiple personalized concepts in a single image, and keeping a small model size. We present Perfusion, a T2I personalization method that addresses these challenges using dynamic rank-1 updates to the underlying T2I model. Perfusion avoids overfitting by introducing a new mechanism that "locks" new concepts' cross-attention Keys to their superordinate category. Additionally, we develop a gated rank-1 approach that enables us to control the influence of a learned concept during inference time and to combine multiple concepts. This allows runtime-efficient balancing of visual-fidelity and textual-alignment with a single 100KB trained model, which is five orders of magnitude smaller than the current state of the art. Moreover, it can span different operating points across the Pareto front without additional training. Finally, we show that Perfusion outperforms strong baselines in both qualitative and quantitative terms. Importantly, key-locking leads to novel results compared to traditional approaches, allowing to portray personalized object interactions in unprecedented ways, even in one-shot settings.
研究动机与目标
- 为解决文本到图像个性化中的过拟合问题,特别是注意力机制中'何处'路径(键)的过拟合,该问题会降低文本对齐度与泛化能力。
- 在模型大小比当前最先进方法小五个数量级的前提下,实现高视觉保真度与强文本对齐能力。
- 通过可控的门控机制,在推理时实现对视觉保真度与文本对齐度的动态、实时平衡。
- 支持在单个提示中组合多个独立训练的概念,包括它们之间的复杂交互。
- 通过基于上位类别的键锁机制,实现一次示例个性化,提升鲁棒性与泛化能力。
提出的方法
- 提出一种键锁机制,将概念键固定到其上位类别的键(如将'teddybear'锁定至'teddy'),防止对特定空间布局的过拟合。
- 将值投影视为扩展的潜在空间,并与输入词嵌入联合优化,以编码视觉外观。
- 对 K 和 V 投影矩阵应用门控秩-1更新,实现在推理阶段选择性地应用概念更新。
- 使用门控机制在推理时控制概念影响的强度,从而实现无需重新训练或模型特化的视觉保真度与文本对齐度之间的运行时权衡。
- 采用双路径注意力视角:键作为'何处'(空间布局),值作为'什么'(视觉外观),个性化聚焦于'什么'路径。
- 使用重建提示进行训练,以稳定学习过程并提升对齐度,尤其在结合上位类键锁机制时效果更显著。
实验结果
研究问题
- RQ1将个性化概念的交叉注意力键锁定至其上位类别,能否减少过拟合并提升文本对齐度?
- RQ2门控秩-1更新机制能否实现在推理时对概念影响的控制,并支持文本到图像生成中的多概念组合?
- RQ3100KB 的模型能否在保持高视觉保真度与对齐度的前提下,实现与完整微调方法相当的性能?
- RQ4键锁机制对训练动态与泛化能力有何影响,特别是在一次示例或零样本设置下?
- RQ5在原始扩散模型上训练的概念,能否成功迁移到微调后的变体(如 InkPunk-v2 或 Protogen-v3.4)?
主要发现
- Perfusion 仅需每概念 100KB 的参数量,即可实现高视觉保真度与强文本对齐能力,相比当前最先进方法缩小了五个数量级。
- 键锁机制显著减少了注意力'何处'路径中的过拟合,相比基线方法提升了文本对齐得分。
- 门控秩-1更新机制实现了无需重新训练或模型特化的视觉保真度与文本对齐度之间的运行时平衡。
- Perfusion 支持在单个提示中组合多个独立训练的概念,实现了如泰迪熊手持茶壶等新颖的交互效果。
- 该方法可泛化至微调后的扩散模型(如 InkPunk-v2、Protogen-v3.4),展示了零样本迁移能力。
- 一次示例训练仅导致性能轻微下降,且重建提示通过稳定训练动态显著提升了视觉保真度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。