Skip to main content
QUICK REVIEW

[論文レビュー] CogView2: Faster and Better Text-to-Image Generation via Hierarchical Transformers

Ming Ding, Wendi Zheng|arXiv (Cornell University)|Apr 28, 2022
Multimodal Machine Learning Applications被引用数 121
ひとこと要約

CogView2 は階層型トランスフォーマーを用い、ローカル並列自己回帰生成とクロスモーダル一般言語モデル(CogLM)を組み合わせて高解像度のテキストから画像生成を高速化し、DALL-E-2 に競合する結果を達成し、インタラクティブ編集を可能にする。

ABSTRACT

The development of the transformer-based text-to-image models are impeded by its slow generation and complexity for high-resolution images. In this work, we put forward a solution based on hierarchical transformers and local parallel auto-regressive generation. We pretrain a 6B-parameter transformer with a simple and flexible self-supervised task, Cross-modal general language model (CogLM), and finetune it for fast super-resolution. The new text-to-image system, CogView2, shows very competitive generation compared to concurrent state-of-the-art DALL-E-2, and naturally supports interactive text-guided editing on images.

研究の動機と目的

  • より高解像度での高速・スケーラブルなテキストから画像生成の動機付け。
  • テキストと画像トークンを双方向に処理する統一事前学習フレームワーク(CogLM)を開発する。
  • 効率化のために低解像度と高解像度の処理を分離する階層生成を導入する。
  • 局所的な並列自己回帰 refinement(LoPAR)を導入して高解像度画像合成を高速化する。

提案手法

  • CogLM: テキストと画像トークンとマスクベースの自己回帰予測を組み込んだ6Bパラメータのクロスモーダルトランスフォーマー事前学習を提案。
  • 二つのマスクベース事前学習タスクを使用:完全な画像トークンマスキング(テキスト→画像)とテキストマスキングを伴う混合画像パッチ(埋め込みとキャプション付け)。
  • 階層的生成パイプラインを採用:1) 20x20トークンの低解像度画像を生成、2) 直接的な超解像で60x60トークンへマップ、3) LoPARベースの反復的超解像で精緻化。
  • 超解像と refinement 中の局所計算を加速するためのカスタム CUDA カーネルを用いた2D局所アテンションの実装。
  • 画像トークンのクラスタリングサンプリングとテキスト-画像の関連性を高めるテキスト注意のアップウェイト手法により、サンプリングと訓練の効率を向上。

実験結果

リサーチクエスチョン

  • RQ1クロスモーダルで双方向の事前学習目的が、テキストから画像モデルの生成と下流タスクを改善するか。
  • RQ2階層生成パイプラインと局所アテンションおよび LoPAR の組み合わせは、品質を損なうことなく高速で高解像度の画像合成を可能にするか。
  • RQ3ターゲットを絞ったアテンション機構とサンプリング戦略は、生成画像の忠実度と入力テキストへの適合性を改善するか。

主な発見

  • CogView2 は MS-COCO で COCO のファインチューニングなしで、FID-0 が約 24.0、IS が約 22.4 の競合的なFréchet Inception Distance(FID)とInception Score(IS)を達成する。
  • MS-COCO で CogLM をファインチューニングすると FID が 17.5(FID-0)に向上し、他のスケールでの FID も (例: FID-4 が 10.6、FID-8 が 10.4) 減少するが、特定のシーンでは非ファインチューニングモデルが人間評価で有利な場合がある。
  • LoPAR を組み込んだ階層生成は高解像度生成を大幅に高速化し(CogView-styled 自己回帰生成の最大 600 倍程度)、画像品質を維持または向上させる。
  • 大規模ボキャブラリでのトークン生成時の不完全な切り捨てを軽減するためのクラスタサンプリングが、サンプリングの一貫性を改善。
  • 局所 CUDA ベースのアテンションは 2D 局所アテンションを加速し、自己回帰シナリオで full アテンションに対して最大で 40 倍のスピードアップを実現。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。