Skip to main content
QUICK REVIEW

[論文レビュー] Your ViT is Secretly a Hybrid Discriminative-Generative Diffusion Model

Xiulong Yang, Sheng-Min Shih|arXiv (Cornell University)|Aug 16, 2022
Generative Adversarial Networks and Image Synthesis被引用数 15
ひとこと要約

本稿では、生成的モデリングとビジョントランスフォーマー(ViT)を統合する新規モデル、GenViT と HybViT を提案する。両モデルは、画像生成と分類の両方のタスクに同一の ViTバックボーンを用いることで、拡散生成モデリングと ViT を統合する。DDPMフレームワークに ViT を統合することで、MCMCを用いない安定した学習と、従来のハイブリッドモデルに比べて向上した計算効率を実現し、両タスクで最先端の性能を達成する。

ABSTRACT

Diffusion Denoising Probability Models (DDPM) and Vision Transformer (ViT) have demonstrated significant progress in generative tasks and discriminative tasks, respectively, and thus far these models have largely been developed in their own domains. In this paper, we establish a direct connection between DDPM and ViT by integrating the ViT architecture into DDPM, and introduce a new generative model called Generative ViT (GenViT). The modeling flexibility of ViT enables us to further extend GenViT to hybrid discriminative-generative modeling, and introduce a Hybrid ViT (HybViT). Our work is among the first to explore a single ViT for image generation and classification jointly. We conduct a series of experiments to analyze the performance of proposed models and demonstrate their superiority over prior state-of-the-arts in both generative and discriminative tasks. Our code and pre-trained models can be found in https://github.com/sndnyang/Diffusion_ViT .

研究の動機と目的

  • 単一のビジョントランスフォーマー(ViT)が、DDPMにおける標準的な UNet の代わりに生成モデルとして効果的に機能するかを検証すること。
  • 同一の ViT を用いて生成的モデリングと識別的モデリングのギャップを埋め、画像分類と生成の両方を同時に実行できるようにすること。
  • JEM や JEM++ のような MCMC を用いるハイブリッドモデルが抱える不安定性と高い計算コストを克服すること。
  • CNN や GAN に基づく代替手法に比べ、ViT を用いた拡散モデルがスケーラビリティ、安定性、効率性に優れていることを示すこと。
  • 提案手法のロバストネス、不確実性キャリブレーション、OOD検出性能を、既存のベンチマークと比較して分析すること。

提案手法

  • ビジョントランスフォーマーのアーキテクチャを直接 DDPM フレームワークに統合し、標準的な UNet バックボーンの代わりに、拡散プロセスにおけるノイズ除去に ViT を用いる。
  • 変分下界(VLB)目的関数を用いて、逆拡散プロセスにおけるノイズ予測を学習することで、GenViT を純粋な生成モデルとして構築する。
  • 共通の ViT 特徴空間を用い、2つの独立したヘッドを持つことで、画像再構成(拡散を介して)と分類の両方を同時に最適化するハイブリッドモデルである HybViT を開発する。
  • 生成的および識別的タスクの両方で、同一の ViT パrameters を共有することで、パラメータ効率と統計的強度の共有を実現する。
  • MCMC サンプリングの必要がない、再構成損失と交差エントロピー損失を統合した単一の目的関数を用いる。
  • 学習可能な線形投影とマルチヘッド自己注意機構を用いて、潜在的拡散空間における長距離依存性をモデル化する、パッチベースの画像処理を適用する。

実験結果

リサーチクエスチョン

  • RQ1単一のビジョントランスフォーマーが、標準的な UNet の代わりに拡散ベースの画像生成のバックボーンとして効果的に使用可能か?
  • RQ2共有された ViT バックボーン上で生成的および識別的ヘッドを同時に学習させることで、画像生成および分類の両タスクにおける性能にどのような影響を与えるか?
  • RQ3提案手法は、JEM や JEM++ のような MCMC を用いるハイブリッドモデルに比べ、学習の安定性、収束速度、最終的な性能において優れているか?
  • RQ4パッチサイズとモデル次元が、提案モデルにおける生成品質と分類精度のトレードオフに与える影響は何か?
  • RQ5GenViT と HybViT は、尤度、敵対的ロバストネス、不確実性キャリブレーション、OOD検出の観点から、最先端のモデルと比較してどう異なるか?

主な発見

  • HybViT は、STL10 で 87.1% のテスト精度、Inception スコア 6.90、FID 125.5 を達成し、従来のハイブリッドモデルを上回る性能を示した。
  • モデル次元 768 の GenViT は、CIFAR-10 で Inception スコア 7.01、FID 126.6 を達成し、優れた生成性能を示した。
  • HybViT は MCMC を用いるモデルに比べて著しく高速に学習が可能である:CIFAR-10 で単一 GPU で 31.2 時間で学習完了。JEM(K=20) に比べて 101.3 時間を大幅に短縮した。
  • パッチサイズ 6 のモデル(HybViT-ps6)が、精度と生成品質のバランスが最も優れており、81.7% の精度、7.30 の IS を達成した。
  • HybViT は、ベースラインモデルに比べて不確実性キャリブレーションと OOD 検出性能に優れており、ロバストネスの向上を示している。
  • 強力な結果を示したが、高解像度画像の生成品質はパッチサイズ 6 で頭打ちとなり、自己注意機構ではなく線形投影層の制限が原因である可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。