[논문 리뷰] Efficient Spatially Sparse Inference for Conditional GANs and Diffusion Models
이 논문은 공간적 희소 추론(Spatially Sparse Inference, SSI)과 희소 증분 생성 엔진(Sparse Incremental Generative Engine, SIGE)을 제안한다. 이는 편집되지 않은 영역의 캐시된 특징 맵을 재사용하고, 빈약하게만 변경된 영역에 대해만 업데이트하는 일반 목적의 방법으로, 조건부 GAN 및 확산 모델의 추론 속도를 가속화한다. SIGE는 Stable Diffusion에 대해 NVIDIA RTX 3090에서 최대 7.2×, Apple M1 Pro GPU에서 5.2×의 추론 속도 향상을 달성했으며, 품질 손실가 최소화되고 계산량도 크게 감소한다.
During image editing, existing deep generative models tend to re-synthesize the entire output from scratch, including the unedited regions. This leads to a significant waste of computation, especially for minor editing operations. In this work, we present Spatially Sparse Inference (SSI), a general-purpose technique that selectively performs computation for edited regions and accelerates various generative models, including both conditional GANs and diffusion models. Our key observation is that users prone to gradually edit the input image. This motivates us to cache and reuse the feature maps of the original image. Given an edited image, we sparsely apply the convolutional filters to the edited regions while reusing the cached features for the unedited areas. Based on our algorithm, we further propose Sparse Incremental Generative Engine (SIGE) to convert the computation reduction to latency reduction on off-the-shelf hardware. With about $1\%$-area edits, SIGE accelerates DDPM by $3.0 imes$ on NVIDIA RTX 3090 and $4.6 imes$ on Apple M1 Pro GPU, Stable Diffusion by $7.2 imes$ on 3090, and GauGAN by $5.6 imes$ on 3090 and $5.2 imes$ on M1 Pro GPU. Compared to our conference version, we extend SIGE to accommodate attention layers and apply it to Stable Diffusion. Additionally, we offer support for Apple M1 Pro GPU and include more results with large and sequential edits.
연구 동기 및 목표
- 소규모 편집에도 불구하고 전체 이미지를 다시 생성하는 기존 생성 모델의 비효율성을 해결하기 위해, 낭비되는 계산을 줄이기 위해.
- 이미지 품질을 훼손하지 않고도 실시간 인터랙티브 이미지 편집을 가능하게 하기 위해, 추론 지연 시간을 줄이기 위해.
- 상용 모델과 기존 압축 기법과 호환되는 일반 목적의 하드웨어 효율적인 추론 엔진을 개발하기 위해.
- 확산 모델과 GAN에서 컨볼루션 레이어와 어텐션 메커니즘을 모두 지원하여, Stable Diffusion와 같은 현대 아키텍처로의 적용 범위를 확장하기 위해.
- 소비자용 GPU와 Apple M1 Pro를 포함한 다양한 하드웨어에서 실용적인 가속을 제공하면서도, 생성된 이미지의 전역 일관성을 유지하기 위해.
제안 방법
- 편집되지 않은 영역에서 이전 추론 단계의 특징 맵을 캐시하고 재사용하여 중복 계산을 방지한다.
- 변경된 영역를 식별하기 위해 차이 마스크를 계산하고, 이 희소한 공간적 위치에만 컨볼루션 필터를 적용한다.
- 가져오기-산산이 흩트리기 패턴을 사용해 희소 업데이트 연산을 적용하여, 편집된 영역에만 효율적으로 업데이트하고 캐시된 활성화를 재사용한다.
- 편집되지 않은 쿼리 토큰을 제거하여 어텐션 레이어로의 확장을 도모하고, 편집 크기에 비례해 어텐션 맵 계산을 크게 줄인다.
- 이론적 계산 절감을 실제 지연 시간 감소로 번역할 수 있도록 하드웨어 최적화된 추론 엔진으로 SIGE를 구현한다. 이는 일반 GPU와 CPU에서 측정 가능한 지연 시간 감소를 이끈다.
- 편집 간 상태를 유지함으로써 증분 추론을 지원하고, 편집 워크플로우에서 빠른 미리보기 및 상호작용을 가능하게 한다.
실험 결과
연구 질문
- RQ1전체 이미지를 다시 생성하는 대신 편집된 영역에만 선택적으로 업데이트함으로써, 조건부 GAN 및 확산 모델의 계산량을 줄일 수 있는가?
- RQ2공간적 희소성에 의해 추론 속도를 높일 때, 이미지의 전역 일관성을 유지할 수 있는가?
- RQ3제안된 방법이 소비자용 GPU와 Apple M1 Pro를 포함한 표준 하드웨어에서 효율적으로 실행되어 저지연 실시간 편집을 달성할 수 있는가?
- RQ4편집 크기와 모델 아키텍처의 다양성, 특히 자기-어텐션 및 크로스-어텐션 레이어를 포함한 아키텍처에서 이 방법의 확장성은 어떠한가?
- RQ5이 방법이 기존의 모델 압축 기법과 조합될 경우, 계산 비용을 추가로 줄일 수 있는가?
주요 결과
- SIGE는 Stable Diffusion에 대해 NVIDIA RTX 3090에서 최대 7.2×의 속도 향상을 기록했고, GauGAN에선 1.2%의 편집 영역에서 5.6×의 속도 향상을 기록했다.
- Apple M1 Pro GPU에서는 GauGAN에 대해 5.2×의 속도 향상, DDPM에선 4.6×의 속도 향상을 기록하여, 다양한 플랫폼 간 효과성을 입증했다.
- DDPM에선 MACs를 최대 7.5× 감소시키고, RTX 3090에서 지연 시간을 3.0× 감소시켰으며, 편집 영역이 1.2%일 때 성능을 보였다.
- GauGAN에선 최대 18×, Stable Diffusion에선 8.2×의 계산량 감소를 Multiply-Accumulate 연산 기준으로 측정했다.
- GAN 압축과 결합했을 때, GauGAN의 계산량은 최대 47×로 감소했으며, 모델 압축과의 강력한 상호보완성을 보였다.
- 쿼리 토큰 제거를 통해 어텐션 레이어를 지원함으로써, 편집 크기에 비례해 어텐션 계산을 줄였고, Stable Diffusion와 같은 모델에서 효율적인 추론을 가능하게 했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.