Skip to main content
QUICK REVIEW

[論文レビュー] MobileDiffusion: Instant Text-to-Image Generation on Mobile Devices

Yang Zhao, Yanwu Xu|arXiv (Cornell University)|Nov 28, 2023
Generative Adversarial Networks and Image Synthesis被引用数 4
ひとこと要約

MobileDiffusionは、アーキテクチャの剪定と高度なサンプリング技術を用いて、モバイルデバイスに最適化された高効率なテキストから画像への拡散モデルを導入し、512×512画像生成においてiPhone 15 Proで0.2秒というサブ秒未満の推論を達成しながら、高品質な出力を維持することで、デバイス内生成分野における新たな最先端水準を確立した。

ABSTRACT

The deployment of large-scale text-to-image diffusion models on mobile devices is impeded by their substantial model size and slow inference speed. In this paper, we propose extbf{MobileDiffusion}, a highly efficient text-to-image diffusion model obtained through extensive optimizations in both architecture and sampling techniques. We conduct a comprehensive examination of model architecture design to reduce redundancy, enhance computational efficiency, and minimize model's parameter count, while preserving image generation quality. Additionally, we employ distillation and diffusion-GAN finetuning techniques on MobileDiffusion to achieve 8-step and 1-step inference respectively. Empirical studies, conducted both quantitatively and qualitatively, demonstrate the effectiveness of our proposed techniques. MobileDiffusion achieves a remarkable extbf{sub-second} inference speed for generating a $512 imes512$ image on mobile devices, establishing a new state of the art.

研究の動機と目的

  • 大規模なテキストから画像への拡散モデルをモバイルデバイスにデプロイする課題に、モデルサイズの大きさと推論速度の遅さという点で対処する。
  • エッジデプロイに向けた拡散モデルにおける、パrameter数の多さと反復的サンプリングという二重のボトル neck を克服する。
  • 単なるブロックの削除を越えた、コンponentレベルの最適化に焦点を当てた、UNetベースの拡散モデルの包括的なアーキテクチャ効率フレームワークを構築する。
  • アーキテクチャの効率化と最先端のサンプリング加速技術(蒸留とGAN微調整)を組み合わせることで、実用的なデバイス内推論を実現する。
  • 制御可能な生成や微調整が可能な、軽量で高性能なテキストから画像へのモデルの実用的 viable な実装を、実世界のモバイルアプリケーションに示す。

提案手法

  • 冗長なコンponentを特定・削除するため、UNetアーキテクチャの包括的な分析を実施し、パrameter数の削減と計算効率の向上を図る。
  • アテンションメカニズムと特徴マップのダイナミクスに関する知見を基に、システム的なブロックの剪定と再編成により、4億パラメータ未満の軽量UNetを設計する。
  • config-aware蒸留を適用し、品質を保持しつつ、サンプリングステップ数を削減した8ステップ推論モデルを訓練する。
  • UFOGen微調整を活用し、GANベースの蒸留によりサンプル効率を高め、1ステップ推論を可能にし、品質の低下を最小限に抑える。
  • 最適化されたアーキテクチャと既存のサンプリング加速技術を統合し、モバイルハードウェア上でエンドツーエンドのサブ秒未満推論を実現する。
  • iPhone 15 Pro上でネイティブ推論ツールを用いてベンチマークを実施し、テキストエンコーダ、VAEデコーダ、UNet、全体のパイプラインにおける遅延を測定する。

実験結果

リサーチクエスチョン

  • RQ1アーキテクチャ最適化を通じて、モバイルデプロイに最適化された、完全に新規に設計された高効率なテキストから画像への拡散モデルを構築できるか?
  • RQ2軽量アーキテクチャ上で、蒸留とGANベースの微調整を用いることで、画像品質を損なわず、どの程度サンプリング速度を短縮できるか?
  • RQ3アーキテクチャの効率化とサンプリング加速の組み合わせが、モバイルデバイスにおける実世界の推論遅延にどのように影響を与えるか?
  • RQ4得られたモデルは、制御可能な生成やLoRA微調整といった後続の応用を、デバイス内で効果的にサポートできるか?
  • RQ5スピード、品質、モデルサイズの観点から、デバイス内テキストから画像への生成の性能上限はどこにあるか?

主な発見

  • MobileDiffusionは、iPhone 15 Proで512×512画像生成において0.2秒というサブ秒未満の推論時間を達成し、先行研究を大きく上回った。
  • 8ステップの蒸留モデルは、MS-COCOデータセットでFIDスコア9.01を達成し、SD-replicatedベースライン(FID 8.43)と同等の品質を維持しながら、サイズは50%小さく、50%速くなった。
  • UFOGen微調整を施した1ステップモデルはFIDが11.67を記録し、品質の低下を最小限に抑えつつ、1ステップ推論が実現可能であることを示した。
  • 両方の蒸留モデルと1ステップモデルのCLIP-ViT-g/14スコアは約0.33であり、CLIP埋め込み空間との強い整合性を示している。
  • デバイス内遅延測定では、MobileDiffusionが全体の推論時間を8ステップで1.23秒、1ステップで2.19秒に短縮し、SnapFusionなどの先行手法を上回った。
  • モデルは、LoRAやアダプタベース手法を含む、制御可能な生成タスクのデバイス内微調整を効果的にサポートしており、実世界のモバイルアプリケーションにおける実用的価値を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。