[論文レビュー] Efficient Spatially Sparse Inference for Conditional GANs and Diffusion Models
本稿では、空間的にスパースな推論(SSI)とスパースインクリメンタル生成エンジン(SIGE)を提案する。SIGEは、編集されていない画像領域のキャッシュされた特徴マップを再利用し、変更された領域にのみスパースに更新を行う一般化された手法であり、条件付きGANや拡散モデルの推論を高速化する。SIGEは、Stable DiffusionにおいてNVIDIA RTX 3090で最大7.2倍、Apple M1 Pro GPUで5.2倍の推論速度向上を達成し、品質損失は最小限で計算量の大幅な削減が可能である。
During image editing, existing deep generative models tend to re-synthesize the entire output from scratch, including the unedited regions. This leads to a significant waste of computation, especially for minor editing operations. In this work, we present Spatially Sparse Inference (SSI), a general-purpose technique that selectively performs computation for edited regions and accelerates various generative models, including both conditional GANs and diffusion models. Our key observation is that users prone to gradually edit the input image. This motivates us to cache and reuse the feature maps of the original image. Given an edited image, we sparsely apply the convolutional filters to the edited regions while reusing the cached features for the unedited areas. Based on our algorithm, we further propose Sparse Incremental Generative Engine (SIGE) to convert the computation reduction to latency reduction on off-the-shelf hardware. With about $1\%$-area edits, SIGE accelerates DDPM by $3.0 imes$ on NVIDIA RTX 3090 and $4.6 imes$ on Apple M1 Pro GPU, Stable Diffusion by $7.2 imes$ on 3090, and GauGAN by $5.6 imes$ on 3090 and $5.2 imes$ on M1 Pro GPU. Compared to our conference version, we extend SIGE to accommodate attention layers and apply it to Stable Diffusion. Additionally, we offer support for Apple M1 Pro GPU and include more results with large and sequential edits.
研究の動機と目的
- 微小な編集に対しても画像全体を再合成してしまう既存の生成モデルの非効率性を解消し、計算を無駄にしないようにすること。
- 画像品質を損なわずに、リアルタイムなインタラクティブな画像編集を可能にするために推論遅延を低減すること。
- 市販のモデルや既存の圧縮技術と互換性がある、汎用的でハードウェアに最適化された推論エンジンを開発すること。
- 拡散モデルやGANにおける畳み込み層とアテンションメカニズムの両方をサポートし、Stable Diffusionのような現代的なアーキテクチャへの適用可能性を拡張すること。
- 消費者用GPUやApple M1 Proを含む多様なハードウェアで実用的な高速化を実現し、生成画像のグローバルな一貫性を維持すること。
提案手法
- 編集されていない領域の前回の推論ステップからの特徴マップをキャッシュして再利用し、重複計算を回避する。
- 差分マスクを計算して新たに編集された領域を特定し、変更されたスパースな空間的位置にのみ畳み込みフィルタを適用する。
- 収集・散乱(gather-scatter)パターンを用いたスパース更新操作を適用し、編集された領域にのみ効率的に更新を行い、キャッシュされた活性化値を再利用する。
- アテンション層に対しても、編集されていないクエリトークンをプルーニングすることで拡張し、編集サイズに比例してアテンションマップ計算を大幅に削減する。
- 理論的な計算削減を、一般的なGPUやCPU上で測定可能な遅延低減に変換する、ハードウェア最適化された推論エンジンとしてSIGEを実装する。
- 編集間隔を維持してステートを保持することでインクリメンタル推論をサポートし、編集ワークフローにおける高速プレビューと相互作用を可能にする。
実験結果
リサーチクエスチョン
- RQ1画像全体を再計算するのではなく、編集された領域にのみ選択的に更新することで、条件付きGANや拡散モデルにおける計算量を削減できるか?
- RQ2空間的スパarsityを用いた推論高速化においても、グローバルな画像の一貫性を維持できるか?
- RQ3本手法は、消費者用GPUやApple M1 Proを含む標準ハードウェアでも効率的に実装可能であり、低遅延のインタラクティブ編集を実現できるか?
- RQ4本手法は、自己注意・クロス注意層を含むさまざまな編集サイズやモデルアーキテクチャにどのようにスケーリング可能か?
- RQ5既存のモデル圧縮技術と組み合わせることで、さらに計算コストを削減できるか、その程度はどの程度か?
主な発見
- SIGEは、Stable DiffusionにおいてNVIDIA RTX 3090で最大7.2倍、GauGANで1.2%の編集領域に対して5.6倍の速度向上を達成した。
- Apple M1 Pro GPUでは、GauGANで5.2倍、DDPMで4.6倍の速度向上を示し、クロスプラットフォームでの有効性を実証した。
- DDPMでは、RTX 3090でMACsを最大7.5倍削減、遅延を3.0倍低減した(編集領域1.2%)。
- GauGANでは最大18倍、Stable Diffusionでは8.2倍の計算量削減が、乗算累積演算(Multiply-Accumulate operations)で測定された。
- GAN圧縮と組み合わせた場合、GauGANの計算量は最大47倍まで削減され、モデル圧縮と強い相乗効果を示した。
- クエリトークンのプルーニングによりアテンション層をサポートし、編集サイズに比例してアテンション計算を削減し、Stable Diffusionのようなモデルでも効率的な推論を可能にした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。