[论文解读] Faces à la Carte: Text-to-Face Generation via Attribute Disentanglement
该论文提出 TTF-HD,一种文本到人脸生成模型,通过使用多标签 BERT 分类器和微调的 MobileNet 图像编码器对人脸属性进行解耦,实现了高分辨率(1024×1024)人脸合成,具有强文本到图像一致性与高多样性。该方法通过重新加权、差异化处理的向量在 40 个正交属性轴上操作噪声向量,实现从自然语言描述中条件生成多样化、高保真度的人脸图像,在 Inception Score、余弦相似度和感知多样性方面优于先前方法。
Text-to-Face (TTF) synthesis is a challenging task with great potential for diverse computer vision applications. Compared to Text-to-Image (TTI) synthesis tasks, the textual description of faces can be much more complicated and detailed due to the variety of facial attributes and the parsing of high dimensional abstract natural language. In this paper, we propose a Text-to-Face model that not only produces images in high resolution (1024x1024) with text-to-image consistency, but also outputs multiple diverse faces to cover a wide range of unspecified facial features in a natural way. By fine-tuning the multi-label classifier and image encoder, our model obtains the vectors and image embeddings which are used to transform the input noise vector sampled from the normal distribution. Afterwards, the transformed noise vector is fed into a pre-trained high-resolution image generator to produce a set of faces with the desired facial attributes. We refer to our model as TTF-HD. Experimental results show that TTF-HD generates high-quality faces with state-of-the-art performance.
研究动机与目标
- 解决从自然语言描述生成高分辨率、多样化且语义一致的人脸的挑战。
- 通过将人脸属性解耦至 40 维正交特征空间,提升文本到人脸的一致性。
- 从单一文本描述生成多个多样化的人脸图像,以支持在刑事调查等实际应用中选择最佳匹配。
- 通过实现对代表性不足群体的条件化合成,减少对侵犯同意的人脸数据集的依赖。
- 建立一种稳健且合乎伦理的现有人脸生成方法替代方案,此类方法常存在偏见与解耦性差的问题。
提出的方法
- 基于预训练 BERT 的多标签分类器从输入描述生成稀疏的 40 维文本嵌入。
- 微调的 MobileNet 模型从图像中预测 40 个人脸属性,实现文本与图像特征空间的对齐。
- 利用噪声向量与预测标签构建 40 个轴的正交坐标系,实现潜在空间的方向性操作。
- 使用差异化向量对噪声向量进行重加权,并以 1.2 的步长缩放,确保沿目标属性轴的稳定移动。
- 将修改后的噪声向量输入预训练的 StyleGAN2 生成器,生成高分辨率、解耦的人脸图像。
- 通过在相同潜在噪声向量上应用特定属性的变换,实现多样化人脸的条件化生成。
实验结果
研究问题
- RQ1文本到人脸生成模型能否生成与自然语言描述具有强语义一致性的高分辨率(1024×1024)图像?
- RQ2该模型能否在保留指定属性的前提下,从单一文本描述生成多个多样化的人脸图像?
- RQ3将人脸属性解耦至 40 维正交空间是否能提升对生成人脸特征的控制能力?
- RQ4与 AttnGAN 等最先进模型相比,该方法在图像质量、多样性与文本到图像相似性方面表现如何?
- RQ5该模型在多大程度上缓解了人脸生成中与数据隐私和代表性偏差相关的伦理问题?
主要发现
- TTF-HD 的 Inception Score (IS) 达到 1.117 ± 0.127,优于 AttnGAN 的 1.062 ± 0.051,表明图像质量更优。
- 模型的余弦相似度(CS)得分为 0.664,显著高于 AttnGAN 的 0.511,证明其具有更好的文本到人脸一致性。
- LPIPS 得分为 0.583 ± 0.002,表明生成图像具有强感知多样性,尤其在单句描述下表现突出。
- 消融实验表明,应用全部四项噪声向量操作可实现最佳平衡:IS(1.122 ± 0.043)、CS(0.754)与 LPIPS(0.634),证实方法的有效性。
- 组 A(使用所有提议操作)在多样性方面表现最佳,IS 与 CS 得分分别为第二高,证实方法的稳健性。
- 尽管性能优异,模型偶尔仍会生成带伪影或一致性较差的图像,表明分类器准确度与潜在空间解耦性仍存在局限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。