[论文解读] Face Aging via Diffusion-based Editing
本文提出 FADING,这是首个基于扩散模型的面部老化方法,利用大规模图文扩散模型生成逼真的年龄转换。通过使用与年龄相关的微调来专门化预训练扩散模型,将输入图像反演为潜在噪声,并使用双提示的文本引导注意力控制,FADING 在多种年龄范围和复杂条件下实现了更高的老化准确性、属性保留度和图像质量。
In this paper, we address the problem of face aging: generating past or future facial images by incorporating age-related changes to the given face. Previous aging methods rely solely on human facial image datasets and are thus constrained by their inherent scale and bias. This restricts their application to a limited generatable age range and the inability to handle large age gaps. We propose FADING, a novel approach to address Face Aging via DIffusion-based editiNG. We go beyond existing methods by leveraging the rich prior of large-scale language-image diffusion models. First, we specialize a pre-trained diffusion model for the task of face age editing by using an age-aware fine-tuning scheme. Next, we invert the input image to latent noise and obtain optimized null text embeddings. Finally, we perform text-guided local age editing via attention control. The quantitative and qualitative analyses demonstrate that our method outperforms existing approaches with respect to aging accuracy, attribute preservation, and aging quality.
研究动机与目标
- 解决现有面部老化方法仅依赖有偏见且规模有限的面部数据集所带来的局限性。
- 利用大规模文本到图像扩散模型所蕴含的丰富语义与视觉先验,实现更鲁棒、更具泛化能力的面部老化。
- 实现在大年龄跨度下以及在遮挡、极端姿态等挑战性条件下的准确老化。
- 将与年龄相关的属性与保留身份的特征(如性别和面部表情)解耦。
- 开发一种在老化质量、真实感和属性保真度方面优于最先进 GAN 方法的方法。
提出的方法
- 通过与年龄相关的微调专门化预训练扩散模型,以将年龄与性别、身份等无关特征解耦。
- 使用精心选择的反演技术将输入面部图像反演为潜在噪声,以保留结构细节。
- 从反演的潜在表示中生成优化的空文本嵌入,以指导编辑过程。
- 通过双提示方案实现局部化年龄编辑:一个提示指定源年龄,另一个提示指定目标年龄。
- 采用增强提示,整合语义属性(如“女性”、“微笑”)以改善注意力定位与属性保留。
- 在编辑提示中引入初始年龄估计作为引导,以防止模型漂移并确保有意义的年龄推进。

实验结果
研究问题
- RQ1大规模文本到图像扩散模型能否被有效专门化用于面部老化任务,而不仅限于通用图像编辑?
- RQ2与年龄相关的微调在多大程度上改善了年龄与性别、表情等身份无关属性的解耦?
- RQ3采用注意力控制的双提示编辑方案在多大程度上提升了老化准确性和结构保真度?
- RQ4整合语义属性的增强提示能否同时提升属性保留度与老化真实感?
- RQ5在编辑提示中包含初始年龄信息如何影响模型生成有意义年龄转换的能力?
主要发现
- FADING 在对比方法中取得了最低的 Fréchet Inception Distance (FID) 和 KID 分数(0.660 × 100),表明其图像质量与分布相似性更优。
- 该方法将年龄预测误差(MAE)降低至 9.162 年,优于无训练基线(9.830)和单提示变体(8.781),证明了更高的老化准确性。
- 属性保留显著增强:性别一致性达到 84.10%,超过无训练基线(79.90%)和单提示变体(81.95%)。
- 双提示方案减少了模糊性并改善了结构对齐,当同时使用两个提示时,KID 分数从 0.707 降至 0.660。
- 消融实验表明,增强提示和初始年龄引导至关重要:移除它们会使 MAE 增加 4.543,KID 增加 0.504,表明性能下降。
- 定性结果表明,伪影极少,真实感显著提升,尤其在嘴唇和面部轮廓等困难区域,即使在大年龄跨度下也表现良好。
![Figure 2 : Qualitative comparison with state-of-the-art methods on CelebA-HQ. Images for the other approaches are extracted from [ Gomez-Trenado et al.(2022)Gomez-Trenado, Lathuilière, Mesejo, and Cordón ] .](https://ar5iv.labs.arxiv.org/html/2309.11321/assets/images/celebA_all.png)
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。