Skip to main content
QUICK REVIEW

[論文レビュー] Faces à la Carte: Text-to-Face Generation via Attribute Disentanglement

Tianren Wang, Teng Zhang|arXiv (Cornell University)|Jun 13, 2020
Generative Adversarial Networks and Image Synthesis参考文献 24被引用数 7
ひとこと要約

本論文では、マルチラベル BERT クラス分類器と微調整された MobileNet 画像エンコーダーを用いて顔の属性を分離することで、高解像度(1024×1024)の顔合成を実現する TTF-HD というテキストから顔を生成するモデルを提案する。この手法は、再重み付けされた微分可能なベクトルを用いて40本の直交的属性軸に沿ってノイズベクトルを操作し、自然言語記述から高品質で多様性に富んだ顔を条件付きで生成可能であり、インセプションスコア、コサイン類似度、および知覚的多様性の観点で先行手法を上回る。

ABSTRACT

Text-to-Face (TTF) synthesis is a challenging task with great potential for diverse computer vision applications. Compared to Text-to-Image (TTI) synthesis tasks, the textual description of faces can be much more complicated and detailed due to the variety of facial attributes and the parsing of high dimensional abstract natural language. In this paper, we propose a Text-to-Face model that not only produces images in high resolution (1024x1024) with text-to-image consistency, but also outputs multiple diverse faces to cover a wide range of unspecified facial features in a natural way. By fine-tuning the multi-label classifier and image encoder, our model obtains the vectors and image embeddings which are used to transform the input noise vector sampled from the normal distribution. Afterwards, the transformed noise vector is fed into a pre-trained high-resolution image generator to produce a set of faces with the desired facial attributes. We refer to our model as TTF-HD. Experimental results show that TTF-HD generates high-quality faces with state-of-the-art performance.

研究の動機と目的

  • 自然言語記述から高解像度で多様性に富み、意味的に整合性のある顔を生成する課題に対処すること。
  • 顔の属性を40次元の直交的特徴空間に分離することで、テキストから顔への一貫性を向上させること。
  • 1つのテキスト記述から複数の多様な顔画像を生成し、犯罪捜査などの実世界の応用において最適な一致を特定可能にする。
  • 同意違反を伴う顔データセットへの依存を減らし、代表されていないデモグラフィックグループの条件付き合成を可能にすること。
  • しばしばバイアスと不完全な分離を抱える従来の顔生成手法に対する、堅牢で倫理的な代替手法を確立すること。

提案手法

  • 事前学習済みの BERT をベースとするマルチラベル分類器が、入力記述からスパースな40次元のテキスト埋め込みを生成する。
  • 微調整された MobileNet モデルが画像から40の顔の属性を予測し、テキストと画像の特徴空間を一致可能にする。
  • ノイズベクトルと予測ラベルを用いて、40軸の直交座標系を構築し、潜在空間における方向的制御を可能にする。
  • ステップサイズ 1.2 でスケーリングされた再重み付けされた微分可能なベクトルを用いて、目的の属性軸に沿った安定した移動を保証する。
  • 修正されたノイズベクトルを事前学習済みの StyleGAN2 生成器に供給し、高解像度で分離された顔画像を生成する。
  • 同じ潜在ノイズベクトルに対して属性固有の変換を適用することで、多様な顔の条件付き生成を実現する。

実験結果

リサーチクエスチョン

  • RQ1テキストから顔を生成するモデルは、自然言語記述に対して強い意味的整合性を持つ高解像度(1024×1024)の画像を生成できるか?
  • RQ21つのテキスト記述から、指定された属性を保持したまま、複数の多様な顔画像を生成できるか?
  • RQ3顔の属性を40次元の直交的空間に分離することで、生成された顔の特徴に対する制御性が向上するか?
  • RQ4AttnGAN や最先端のモデルと比較して、本手法は画像品質、多様性、およびテキストから画像への類似度において優れているか?
  • RQ5本モデルは、顔生成におけるデータプライバシーと代表性バイアスに関する倫理的懸念をどの程度軽減できるか?

主な発見

  • TTF-HD はインセプションスコア(IS)1.117 ± 0.127 を達成し、AttnGAN の 1.062 ± 0.051 を上回り、優れた画像品質を示している。
  • コサイン類似度(CS)スコアが 0.664 に達し、AttnGAN の 0.511 より顕著に高く、テキストから顔への一貫性が優れていることを示している。
  • LPIPS スコア 0.583 ± 0.002 は、特に単一文の記述において顕著な知覚的多様性を示しており、強い性能を示している。
  • アブレーションスタディの結果、4つのノイズベクトル操作をすべて適用した場合、IS(1.122 ± 0.043)、CS(0.754)、LPIPS(0.634)のバランスが最良となり、手法の有効性が確認された。
  • すべての提案操作を用いたグループ A は、最高の多様性と2番目の高い IS および CS スコアを達成し、手法の堅牢性を裏付けた。
  • 強力な性能を発揮しているが、一部のケースでアーチファクトや一貫性の欠如が生じる場合があるため、分類器の正確性と潜在空間の分離性に限界がある可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。