[論文レビュー] Hybrid SD: Edge-Cloud Collaborative Inference for Stable Diffusion Models
本稿では、Stable Diffusion モデルのトレーニングフリーなエッジ・クラウド協調推論フレームワーク「Hybrid SD」を提案する。早期のノイズ除去ステップをセマンティックな正確性を確保するためクラウドベースの大規模モデルにオフロードし、後続の精緻化処理を効率性を重視したコンactエッジモデルに委ねる。U-Netの構造的プルーニングと軽量VAEの導入により、エッジデバイス上で競争力のあるFID(12.22)を達成し、パrameter効率性がSOTA(225.8Mパラメータ)に達する一方で、クラウドコストを66%低減する。
Stable Diffusion Models (SDMs) have shown remarkable proficiency in image synthesis. However, their broad application is impeded by their large model sizes and intensive computational requirements, which typically require expensive cloud servers for deployment. On the flip side, while there are many compact models tailored for edge devices that can reduce these demands, they often compromise on semantic integrity and visual quality when compared to full-sized SDMs. To bridge this gap, we introduce Hybrid SD, an innovative, training-free SDMs inference framework designed for edge-cloud collaborative inference. Hybrid SD distributes the early steps of the diffusion process to the large models deployed on cloud servers, enhancing semantic planning. Furthermore, small efficient models deployed on edge devices can be integrated for refining visual details in the later stages. Acknowledging the diversity of edge devices with differing computational and storage capacities, we employ structural pruning to the SDMs U-Net and train a lightweight VAE. Empirical evaluations demonstrate that our compressed models achieve state-of-the-art parameter efficiency (225.8M) on edge devices with competitive image quality. Additionally, Hybrid SD reduces the cloud cost by 66% with edge-cloud collaborative inference.
研究の動機と目的
- 大規模なStable Diffusion モデル(SDMs)をクラウドサーバーにデプロイする際の高い計算コストとプライバシーリスクに対処すること。
- 既存のコンパクトなエッジモデルがしばしばセマンティックの正確性と視覚的品質を犠牲にしているという性能格差を克服すること。
- トレーニングフリーで、クラウドとエッジデバイスの長所を活かした協調推論フレームワークを設計すること。
- 生成品質を損なわずにエッジデバイス上でSOTAのパrameter効率性を達成すること。
- 実用的デプロイメントを可能にする加速技術(例:LCM)との互換性を確保すること。
提案手法
- 拡散プロセスを分散処理する:セマンティック計画のための早期ノイズ除去ステップを大規模クラウドベースSDMで実行し、詳細精緻化のための後続ステップを軽量エッジモデルに委ねる。
- 性能を維持したままモデルサイズを縮小できるように、SDMのU-Netに構造的プルーニングを適用し、リソース制限のあるエッジデバイスへのデプロイを可能にする。
- エッジデプロイ専用に軽量VAEデコーダーを訓練し、品質損失を最小限に抑えつつ全体のモデル容量を削減する。
- 圧縮されたモデルをハイブリッド推論パイプラインに統合し、クラウドとエッジの計算をバランスさせ、データ転送量とクラウドコストを最小限に抑える。
- LCM(潜在一貫性モデル)のような加速サンプリング手法との統合を拡張し、最小限のステップ数で高速推論を実現する。
- 66%のクラウドFLOPsをエッジデバイスにオフロードすることで、遅延とコストを低減するようにシステムを最適化する。

実験結果
リサーチクエスチョン
- RQ1トレーニング再実行を要せず、エッジ・クラウド連携によってStable Diffusion推論の効率性とコスト効率を向上させることができるか?
- RQ2リソース制限のあるエッジデバイスで使用されるコンパクトモデルにおいて、セマンティックの整合性と視覚的品質をどのように維持できるか?
- RQ3構造的プルーニングと軽量VAEを用いることで、どれほどモデルサイズを縮小できるか、かつ競争力のあるFIDスコアを維持できるか?
- RQ4クラウドコストを最小限に抑えつつ遅延を低く保つために、計算をクラウドとエッジの間でどのように最適に分配すべきか?
- RQ5ハイブリッド推論フレームワークは、LCMのような既存の加速技術とどれほど互換性があるか?
主な発見
- Hybrid SDは、2.7兆FLOPsをエッジデバイスにオフロードすることで、クラウド推論コストを66%削減し、クラウドでのFLOPsを15.8兆から5.4兆にまで低減した。
- 圧縮されたエッジモデルは225.8Mパラメータを達成(元のSD-v1.4は909.0M)しながらも、FIDスコア12.22(元の13.75)という競争力のある性能を維持した。
- エッジ・クラウド協調推論により、クラウド遅延が42%削減(1010.5 ms 対 1733.6 ms)され、FLOPsも全クラウド推論と比較して49%低減した。
- スタンドアロンのエッジモデルとは異なり、本フレームワークは優れたセマンティック整合性を維持しており、たとえば「kichen」と誤って生成するなど、プロンプトの正しい属性(例:「two sheep」が欠落するなど)を正しく再現する。
- 軽量VAEにより、エッジ側のFLOPsが42%削減され、画像品質を損なわず効率性が向上した。
- ハイブリッドフレームワークはLCM加速と完全に互換性があり、8ステップサンプリングで最小限の性能低下で高速かつ効率的な推論を実現した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。