[论文解读] Only a Matter of Style: Age Transformation Using a Style-Based Regression Model
本文提出SAM(基于样式的年龄调控),一种通过使用预训练的年龄回归器指导的基于样式的回归模型,将真实输入图像编码到预训练的StyleGAN2的潜在空间中,实现对人脸图像的细粒度、连续的年龄转换。该方法学习了一条解耦的、非线性的潜在路径以实现年龄推进,实现了高保真度、身份保持的年龄变化,且可控制编辑,其在定性和定量评估中均优于先前方法。
The task of age transformation illustrates the change of an individual's appearance over time. Accurately modeling this complex transformation over an input facial image is extremely challenging as it requires making convincing, possibly large changes to facial features and head shape, while still preserving the input identity. In this work, we present an image-to-image translation method that learns to directly encode real facial images into the latent space of a pre-trained unconditional GAN (e.g., StyleGAN) subject to a given aging shift. We employ a pre-trained age regression network to explicitly guide the encoder in generating the latent codes corresponding to the desired age. In this formulation, our method approaches the continuous aging process as a regression task between the input age and desired target age, providing fine-grained control over the generated image. Moreover, unlike approaches that operate solely in the latent space using a prior on the path controlling age, our method learns a more disentangled, non-linear path. Finally, we demonstrate that the end-to-end nature of our approach, coupled with the rich semantic latent space of StyleGAN, allows for further editing of the generated images. Qualitative and quantitative evaluations show the advantages of our method compared to state-of-the-art approaches.
研究动机与目标
- 解决人脸图像中真实、连续的年龄转换同时保持身份的问题。
- 克服先前方法依赖离散年龄组或假设GAN空间中线性、纠缠潜在路径的局限性。
- 通过使用预训练的年龄回归器将年龄变化建模为回归任务,实现对年龄推进的细粒度控制。
- 在StyleGAN的W+空间中学习一条非线性、解耦的潜在路径,以更好地将年龄与其他属性(如发色和面部特征)分离。
- 通过利用StyleGAN潜在空间的丰富语义结构,支持对生成的年龄变化结果进行额外的编辑功能。
提出的方法
- 该方法使用预训练的StyleGAN2生成器生成高质量图像,同时通过一个学习到的编码器将输入人脸图像映射到W+潜在空间。
- 在训练过程中,通过一个辅助的预训练年龄回归网络提供监督,引导编码器生成对应目标年龄的潜在代码。
- 模型采用端到端训练,损失函数结合了身份保持损失(通过ArcFace)、年龄回归损失(基于VGG)和感知损失(VGG特征)。
- 编码器学习到的潜在路径是非线性和解耦的,相比线性路径假设,能实现更准确、更真实的年龄推进。
- 在完成年龄转换后,通过在第8至9层进行风格混合并引入参考图像,实现多模态生成和对光照、发色等全局属性的细粒度编辑。
- 通过在特定风格向量上进行补丁编辑,实现对胡须、眼镜等局部属性的编辑,从而在转换后实现属性特定的操控。
实验结果
研究问题
- RQ1能否将年龄转换建模为预训练GAN潜在空间中的连续回归问题,而非依赖离散的年龄组?
- RQ2在StyleGAN的W+空间中学习非线性、解耦的潜在路径,是否能带来比线性路径假设更真实、更身份保持的年龄推进效果?
- RQ3预训练年龄回归器与端到端训练的结合,是否能对真实人脸图像实现高保真度的年龄转换?
- RQ4生成的年龄变化结果在多大程度上可以通过StyleGAN原生编辑功能进一步编辑?
- RQ5该方法在年轻儿童或极端表情等挑战性情况下的表现如何?其局限性是什么?
主要发现
- SAM在基准数据集上的年龄转换任务中达到最先进性能,在定性和定量评估中均优于现有方法。
- 该方法可实现从任意输入图像到任意目标年龄的连续、细粒度年龄推进,包括极端年龄变化(如5岁到85岁),同时保持高度的身份一致性。
- 与先前的线性路径方法相比,所学习的潜在路径在与其他属性(如发色、面部特征)的解耦方面表现更优,从而实现更真实、更可控的年龄变化。
- 模型的端到端特性使得可通过风格混合和补丁编辑实现额外编辑,支持多模态生成和对生成图像的属性特定操控。
- 该方法在多样化身份和年龄范围上表现出鲁棒性,但对极年轻儿童(<5岁)性能下降,原因在于回归器中的年龄预测偏差。
- 局限性包括对域外输入(如“山姆大叔”)、极端姿势或配饰的处理挑战,以及对复杂变化(如发际线后移、肤色变化)建模的困难。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。