Skip to main content
QUICK REVIEW

[论文解读] DreamIdentity: Improved Editability for Efficient Face-identity Preserved Image Generation

Zhuowei Chen, Shancheng Fang|arXiv (Cornell University)|Jul 1, 2023
Generative Adversarial Networks and Image Synthesis被引用 4
一句话总结

DreamIdentity 提出了一种无需优化的高效方法,通过引入一种 M² ID 编码器,利用多尺度、面向人脸的特征以及多词嵌入,提升身份表征能力。该方法进一步通过利用 T2I 模型生成成对编辑数据,实现自增强的可编辑性学习,从而在无需推理时优化的情况下,实现高身份保留率与灵活的文本引导编辑。

ABSTRACT

While large-scale pre-trained text-to-image models can synthesize diverse and high-quality human-centric images, an intractable problem is how to preserve the face identity for conditioned face images. Existing methods either require time-consuming optimization for each face-identity or learning an efficient encoder at the cost of harming the editability of models. In this work, we present an optimization-free method for each face identity, meanwhile keeping the editability for text-to-image models. Specifically, we propose a novel face-identity encoder to learn an accurate representation of human faces, which applies multi-scale face features followed by a multi-embedding projector to directly generate the pseudo words in the text embedding space. Besides, we propose self-augmented editability learning to enhance the editability of models, which is achieved by constructing paired generated face and edited face images using celebrity names, aiming at transferring mature ability of off-the-shelf text-to-image models in celebrity faces to unseen faces. Extensive experiments show that our methods can generate identity-preserved images under different scenes at a much faster speed.

研究动机与目标

  • 解决在文本到图像生成中保留人脸身份而不需为每个身份进行优化的挑战。
  • 克服现有无优化方法中身份保留与模型可编辑性之间的权衡。
  • 通过用面向人脸的多尺度特征编码器替代通用编码器(如 CLIP),提升身份表征能力。
  • 通过在训练阶段整合编辑任务,使训练与推理目标对齐,从而保持可编辑性。
  • 仅使用单张输入人脸图像,实现跨不同场景的多样化、身份一致图像的高效、实时生成。

提出的方法

  • 提出一种基于视觉变换器的 M² ID 编码器,用于处理人脸图像的多尺度特征,并将其投影到文本嵌入空间中的多个词嵌入。
  • 使用多嵌入投影器生成多个伪词,以比单个嵌入更好地捕捉身份特异性细节。
  • 通过利用预训练的 T2I 模型生成成对图像(原始名人脸与编辑版本,例如“作为警察”),实现自增强的可编辑性学习。
  • 在真实人脸重建数据(来自 FFHQ)与自增强编辑对数据的组合数据集上训练 M² ID 编码器,以同时提升身份保真度与可编辑性。
  • 通过避免为每个身份进行任何优化,保持推理效率,实现每个输入人脸仅需一次前向传播。
  • 将 M² ID 编码器与 ControlNet 集成,实现空间控制,支持通过注视引导的布局控制实现身份保留的场景切换。

实验结果

研究问题

  • RQ1轻量级、无优化的编码器是否能相比 CLIP 基线实现更优的身份保留?
  • RQ2自增强可编辑性学习是否能提升模型在保持身份的同时遵循多样化文本提示的能力?
  • RQ3多尺度特征提取与多词嵌入投影对身份表征准确率有何影响?
  • RQ4在身份保留与文本对齐之间实现平衡的最优词嵌入数量是多少?
  • RQ5该模型是否能在无需微调的情况下泛化到未见过的身份与复杂编辑场景?

主要发现

  • M² ID 编码器通过利用多尺度、面向人脸的特征,将人脸身份保留率从 CLIP 基线的 0.266 提升至 0.412。
  • 使用两个词嵌入在仅导致文本对齐下降 0.4% 的情况下,使人脸相似度提升 12%;而更多嵌入则会降低可编辑性。
  • 自增强可编辑性学习显著提升了编辑能力:未使用该方法训练的模型无法生成正确编辑(如“作为警察”)。
  • 将重建数据(FFHQ)与自增强编辑数据结合,相比单独使用任一数据集,均能获得更高的人脸相似度与提示遵循度。
  • 该方法在单次前向传播中即可实现高质量、身份保留的图像生成,无需任何推理时优化。
  • 定性结果表明,无论在多样化场景还是编辑提示下(包括服装、姿态与背景的变化),模型均能保持一致的身份保留。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。