[论文解读] Persuasive Faces: Generating Faces in Advertisements
本文提出了一种条件变分自编码器(CVAE),通过利用预测的面部属性和表情作为监督信号,生成针对特定广告类别的定制化人脸。该方法在生成视觉上差异明显、主题相关的人脸方面优于最先进的基于GAN的基线模型,人类评估显示其在生成类别特定面部外观方面比次佳方法高效近四倍。
In this paper, we examine the visual variability of objects across different ad categories, i.e. what causes an advertisement to be visually persuasive. We focus on modeling and generating faces which appear to come from different types of ads. For example, if faces in beauty ads tend to be women wearing lipstick, a generative model should portray this distinct visual appearance. Training generative models which capture such category-specific differences is challenging because of the highly diverse appearance of faces in ads and the relatively limited amount of available training data. To address these problems, we propose a conditional variational autoencoder which makes use of predicted semantic attributes and facial expressions as a supervisory signal when training. We show how our model can be used to produce visually distinct faces which appear to be from a fixed ad topic category. Our human studies and quantitative and qualitative experiments confirm that our method greatly outperforms a variety of baselines, including two variations of a state-of-the-art generative adversarial network, for transforming faces to be more ad-category appropriate. Finally, we show preliminary generation results for other types of objects, conditioned on an ad topic.
研究动机与目标
- 探究不同广告类别中使广告对象具有说服力的视觉特征。
- 建立并生成反映特定广告主题(如美容、家庭暴力或苏打广告)独特视觉外观的人脸。
- 通过利用面部属性和表情的语义监督,解决广告特定人脸生成中训练数据有限且多样化的挑战。
- 开发一种生成模型,将大规模数据集中的语义知识迁移至生成逼真、主题相关的人脸外观,而无需新增标注。
- 将该方法扩展至其他物体(如酒精、美容和苏打广告中的瓶子),证明其泛化能力。
提出的方法
- 该方法使用在广告人脸数据上训练的条件变分自编码器(CVAE),其潜在表征基于预测的面部属性和表情进行条件化。
- 面部属性和表情分类器在大规模数据集(如AffectNet)上预先训练,并用于检测广告人脸中的属性(如口红、悲伤)和表情。
- CVAE编码器将真实广告人脸嵌入潜在空间,模型通过潜在码、预测属性和表情学习重建这些人脸。
- 在推理阶段,模型通过使用学习到的各主题间属性和表情差异来修改人脸的潜在嵌入,然后解码生成适用于目标广告类别的新脸。
- 该方法利用外部数据集的语义监督,将视觉差异提升至语义层面,实现在无需对新标签重新训练的情况下实现泛化。
- 该方法通过使用基于广告主题条件化的条件BEGAN模型,扩展至其他物体(如瓶子),证明其在非人脸物体上的可迁移性。
实验结果
研究问题
- RQ1哪些视觉特征可区分不同广告类别中的人脸,如美容广告与家庭暴力广告?
- RQ2生成模型如何在训练数据有限的情况下,学习生成在视觉上合适且具有说服力的特定广告主题人脸?
- RQ3与像素级GAN相比,高层语义监督(面部属性和表情)是否能提升生成人脸的质量和主题特异性?
- RQ4该模型在生成广告中其他物体(如瓶子)的类别特定外观方面,其泛化能力在多大程度上成立?
- RQ5在生成主题相关人脸方面,人类判断与分类器性能在不同人脸生成方法之间如何比较?
主要发现
- 我们的方法在生成主题相关人脸方面的人类偏好得分为0.606,几乎是次佳方法(Conditional)的四倍(0.144)。
- 在我们方法生成的合成数据上训练的分类器,其主题预测准确率达到0.092,优于大多数基线模型,并与StarGAN(Topics)相当,后者在训练期间可访问主题标签。
- 仅使用潜在空间的基线模型表现欠佳(人类偏好得分为0.038),表明面部属性和表情对于捕捉广告主题间语义差异至关重要。
- 该模型成功将同一张人脸转化为五种类别的不同外观——美容(带妆容)、家庭暴力(悲伤,可能有瘀伤)、安全(阳刚)、苏打(快乐)及其他类别,证实其具备生成类别特定视觉修辞的能力。
- 对瓶子的初步结果显示,该模型学习到了有意义的类别特定差异:酒精瓶具有长柄,美容瓶宽大且短柄,苏打瓶具有特征性形状和标签。
- 该方法可泛化至人脸之外,表明条件生成模型可利用语义监督学习广告中同一主题内物体的外观差异。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。