Skip to main content
QUICK REVIEW

[論文レビュー] M6-UFC: Unifying Multi-Modal Controls for Conditional Image Synthesis via Non-Autoregressive Generative Transformers

Zhu Zhang, Jianxin Ma|arXiv (Cornell University)|May 29, 2021
Generative Adversarial Networks and Image Synthesis被引用数 8
ひとこと要約

M6-UFC は、すべての入力および出力を離散トークン列として表現することで、テキスト、視覚的、保存制御を統合する非自己回帰的で BERT をベースとした二段階フレームワークを提案する。このフレームワークは、M2C-Fashion およびマルチモーダル CelebA-HQ で最先端の FID スコアを達成し、自己回帰的ベースラインと比較して 11 倍高速な推論を実現する。また、制御適合性と高精細度を維持するため、関連性および忠実度推定器を備えた段階的非自己回帰生成アルゴリズムを採用する。

ABSTRACT

Conditional image synthesis aims to create an image according to some multi-modal guidance in the forms of textual descriptions, reference images, and image blocks to preserve, as well as their combinations. In this paper, instead of investigating these control signals separately, we propose a new two-stage architecture, M6-UFC, to unify any number of multi-modal controls. In M6-UFC, both the diverse control signals and the synthesized image are uniformly represented as a sequence of discrete tokens to be processed by Transformer. Different from existing two-stage autoregressive approaches such as DALL-E and VQGAN, M6-UFC adopts non-autoregressive generation (NAR) at the second stage to enhance the holistic consistency of the synthesized image, to support preserving specified image blocks, and to improve the synthesis speed. Further, we design a progressive algorithm that iteratively improves the non-autoregressively generated image, with the help of two estimators developed for evaluating the compliance with the controls and evaluating the fidelity of the synthesized image, respectively. Extensive experiments on a newly collected large-scale clothing dataset M2C-Fashion and a facial dataset Multi-Modal CelebA-HQ verify that M6-UFC can synthesize high-fidelity images that comply with flexible multi-modal controls.

研究の動機と目的

  • テキスト、視覚的、保存制御の多様なマルチモーダル制御を、1 つのスケーラブルなフレームワークに統合し、条件付き画像生成を実現すること。
  • 推論速度、包括的整合性、保存制御の取り扱いの点で自己回帰的生成の限界を克服すること。
  • 画像品質と制御適合性を維持しながら、高速な推論を実現する非自己回帰的生成戦略を開発すること。
  • 制御適合性(関連性)と画像品質(忠実度)のための専用推定器を備えた段階的推論アルゴリズムを設計すること。

提案手法

  • VQ-VAE をベースとした最初の段階のエンコーダーを用いて、すべての制御信号と生成画像を離散トークン列として表現し、Transformer 内で統一的に処理可能にする。
  • 自己回帰的モデルと比較して高速な推論を実現するため、双方向の Transformer(BERT スタイル)を用いて非自己回帰的画像生成を実装する。
  • 訓練段階で、マスクされた画像トークンをマルチモーダル制御と未マスクのトークンに条件づけて予測するためのマスクされた系列モデリング目的を採用する。
  • 関連性(制御適合性)と忠実度(画像品質)のための推定器を備えた段階的非自己回帰生成アルゴリズム(PNAG)を導入し、低信頼度のトークンを繰り返し再予測することで、段階的に生成画像の品質を向上させる。
  • 推論段階で、制御信号との整合性を評価するための関連性推定器と、知覚的品質を評価するための忠実度推定器の 2 つの判別的推定器を活用する。
  • PNAG において、各イテレーションで信頼度スコアが最も低い上位 B 個のトークンを選択して再予測する動的マスキング戦略を採用し、収束性と品質の両方を向上させる。

実験結果

リサーチクエスチョン

  • RQ1テキスト、視覚的、保存制御の任意の組み合わせを、条件付き画像生成において統一的なフレームワークが効果的に処理できるか?
  • RQ2双方向的コンテキストを活用した非自己回帰的生成は、自己回帰的手法と比較して画像品質と整合性を向上させられるか?
  • RQ3専用の推定器を備えた段階的非自己回帰推論戦略は、標準的な NAR 手法に比べて忠実度と制御適合性で優れるか?
  • RQ4複数の制御モダリティを組み合わせた際、提案手法の性能と速度はどのようにスケーリングするか?
  • RQ5段階的非自己回帰アルゴリズムにおける並列再予測数(B)といったハイパーパrameter の影響は何か?

主な発見

  • M6-UFC は、M2C-Fashion で 11.14、Multi-Modal CelebA-HQ で 65.30 の最先端の FID スコアを達成し、TediGAN や VQGAN と比較して主要指標で優れた性能を示した。
  • 自己回帰的 VQGAN ベースラインと比較して 11 倍高速な推論速度を達成しながら、すべての指標で画像品質を維持または向上させた。
  • アブレーションスタディでは、関連性および忠実度推定器を備えた段階的 NAR 生成アルゴリズムが、標準的な Mask-Predict よりも画像品質が向上しており、FID および LPIPS スコアが低くなった。
  • アブレーションスタディにより、関連性推定器および忠実度推定器の両方が不可欠であることが確認され、いずれかを削除すると性能が低下した。
  • 並列再予測数(B)を 1 から 10 に増加させることで、FID および LPIPS スコアが一貫して改善され、PNAG 戦略のスケーラビリティとロバスト性が示された。
  • 視覚的例では、M6-UFC が反事実的テキスト記述に対しても高精細度の画像を正しく生成できており、強力な制御適合性と現実性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。