[論文レビュー] Persuasive Faces: Generating Faces in Advertisements
本稿では、予測された顔面属性および表情を教師信号として用いることで、特定の広告カテゴリーに適合した顔を生成する条件付き変分オートエンコーダ(CVAE)を提案する。この手法は、視覚的に明確でトピックに適した顔を生成する点で、最先端のGANベースのベースラインを上回り、人間による評価では、次に優れた手法の約4倍の効果を示している。
In this paper, we examine the visual variability of objects across different ad categories, i.e. what causes an advertisement to be visually persuasive. We focus on modeling and generating faces which appear to come from different types of ads. For example, if faces in beauty ads tend to be women wearing lipstick, a generative model should portray this distinct visual appearance. Training generative models which capture such category-specific differences is challenging because of the highly diverse appearance of faces in ads and the relatively limited amount of available training data. To address these problems, we propose a conditional variational autoencoder which makes use of predicted semantic attributes and facial expressions as a supervisory signal when training. We show how our model can be used to produce visually distinct faces which appear to be from a fixed ad topic category. Our human studies and quantitative and qualitative experiments confirm that our method greatly outperforms a variety of baselines, including two variations of a state-of-the-art generative adversarial network, for transforming faces to be more ad-category appropriate. Finally, we show preliminary generation results for other types of objects, conditioned on an ad topic.
研究の動機と目的
- 広告の異なるカテゴリーにおいて、広告の説得力に寄与する視覚的特徴を特定すること。
- ビューティ、DV、ソーダ広告など、特定の広告トピックに特徴的な視覚的外見を反映する顔をモデル化・生成すること。
- 広告固有の顔生成に向けた限られた多様な訓練データの課題に対処するため、顔面属性と表情からの意味的監視を用いること。
- 新しいラベルを必要とせずに、大規模データセットからの意味的知識を転送し、現実的でトピックに適した顔の外見を生成する生成モデルを開発すること。
- 顔にとどまらず、アルコール、ビューティ、ソーダ広告におけるボトルなど、他のオブジェクトに対してもこのアプローチを拡張し、一般化可能性を示すこと。
提案手法
- 顔面属性と表情の予測値を条件として用いる条件付き変分オートエンコーダ(CVAE)を広告顔で訓練する。
- 顔面属性および表情分類器は、大規模データセット(例:AffectNet)で事前学習し、広告顔内の属性(例:口紅)および表情(例:悲しみ)を検出するために適用する。
- CVAEのエンコーダは、実際の広告顔を潜在空間に埋め込み、潜在コード、予測された属性、表情を用いて再構成を学習する。
- 推論時、モデルは顔の潜在埋め込みを、各トピックごとの属性および表情の差分に従って変更し、その結果をデコードして、目的の広告カテゴリーに適した新しい顔を生成する。
- 外部データセットからの意味的監視を活用することで、視覚的ばらつきを意味的レベルに高め、新しいラベルの再トレーニングなしに一般化を可能にする。
- 顔以外のオブジェクト(例:ボトル)に対しても、広告トピックを条件とする条件付きBEGANモデルを用いて拡張し、非顔オブジェクトへの転送可能性を示している。
実験結果
リサーチクエスチョン
- RQ1ビューティ広告とDV広告の例として、異なる広告カテゴリーにおける顔の視覚的特徴は何か。
- RQ2限られた訓練データがある中で、生成モデルが特定の広告トピックに適した視覚的に適切で説得力のある顔を学習・生成できるか。
- RQ3ピクセルレベルのGANと比較して、高レベルの意味的監視(顔面属性と表情)が、生成顔の品質およびトピック固有性を向上させられるか。
- RQ4モデルが、広告におけるトピック固有の外見を持つ他のオブジェクト(例:ボトル)を生成する能力はどの程度一般化可能か。
- RQ5人間の判断と分類器の性能は、異なる顔生成手法において、トピックに適した顔を生成する際、どのように比較されるか。
主な発見
- 本手法は、トピックに適した顔を生成する際、人間の好みスコアが0.606を達成し、次に優れた手法(Conditional)の0.144のおよそ4倍にのぼった。
- 本手法から生成された合成データで訓練した分類器は、トピック予測精度が0.092を達成し、大多数のベースラインを上回り、トレーニング時にトピックラベルにアクセスできるStarGAN(Topics)と同等の性能を示した。
- 潜在空間のみを用いるベースラインは著しく劣悪な結果(人間の好みスコア0.038)を示し、顔面属性と表情が広告トピック間の意味的差を捉えるために不可欠であることを示している。
- 同じ顔を、ビューティ(化粧あり)、DV(悲しそうで、打撲の可能性あり)、セーフティ(男性らしさ)、ソーダ(明るい表情)、その他のカテゴリーの5つに応じて、明確に異なる外見に変換できた。これは、トピック固有の視覚的修辞を生成できる能力を裏付けている。
- ボトルに関する予備的結果では、モデルが意味的なトピック固有の差を学習していることが示された:アルコールボトルは長いストローク、ビューティボトルは幅広で短いストローク、ソーダボトルは特徴的な形状とラベルを持つ。
- 本手法は顔にとどまらず、意味的監視を用いることで、条件付き生成モデルが広告内のトピック内オブジェクト外見のばらつきを学習できることを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。