Skip to main content
QUICK REVIEW

[논문 리뷰] Anycost GANs for Interactive Image Synthesis and Editing

Ji Lin, Richard Zhang|arXiv (Cornell University)|2021. 03. 04.
Generative Adversarial Networks and Image Synthesis참고 문헌 79인용 수 8
한 줄 요약

이 논문은 상호작용 가능한 이미지 합성 및 편집을 위한 가변 해상도 및 적응형 채널 추론을 지원하는 단일 생성기 아키텍처인 Anycost GAN을 제안한다. 공유 가중치, 단계별 최적화 및 생성기 조건부 판별기로 통합 생성기를 훈련시킴으로써, CPU에서 최대 11.9×, 엣지 GPU에서 최대 8.5×의 속도 향상을 이룰 수 있으며, 전체 모델에 비해 품질 손실가 최소화된 시각적으로 일관된 미리보기 기능을 제공한다.

ABSTRACT

Generative adversarial networks (GANs) have enabled photorealistic image synthesis and editing. However, due to the high computational cost of large-scale generators (e.g., StyleGAN2), it usually takes seconds to see the results of a single edit on edge devices, prohibiting interactive user experience. In this paper, we take inspirations from modern rendering software and propose Anycost GAN for interactive natural image editing. We train the Anycost GAN to support elastic resolutions and channels for faster image generation at versatile speeds. Running subsets of the full generator produce outputs that are perceptually similar to the full generator, making them a good proxy for preview. By using sampling-based multi-resolution training, adaptive-channel training, and a generator-conditioned discriminator, the anycost generator can be evaluated at various configurations while achieving better image quality compared to separately trained models. Furthermore, we develop new encoder training and latent code optimization techniques to encourage consistency between the different sub-generators during image projection. Anycost GAN can be executed at various cost budgets (up to 10x computation reduction) and adapt to a wide range of hardware and latency requirements. When deployed on desktop CPUs and edge devices, our model can provide perceptually similar previews at 6-12x speedup, enabling interactive image editing. The code and demo are publicly available: https://github.com/mit-han-lab/anycost-gan.

연구 동기 및 목표

  • 자원이 제한된 디바이스에서 고해상도 GAN의 추론 지연을 줄여 상호작용 가능한 이미지 편집을 가능하게 하기 위해.
  • 재학습이나 미세조정 없이도 다양한 계산 비용을 지원하는 단일 생성기를 훈련하기 위해.
  • 이미지 투영 및 편집 중에 해상도와 채널 수가 다른 부분 생성기 간의 시각적 일관성을 유지하기 위해.
  • 공유 가중치와 다양한 부분 아키텍처를 가진 다수의 생성기들이 공존하는 다수 플레이어 GAN 환경에서 훈련을 안정화하기 위해.
  • 다양한 생성기 구성 간에 일관된 잠재 코드 매핑을 보장하는 인코더 및 최적화 기법을 개발하기 위해.

제안 방법

  • 다양한 해상도와 채널 수를 가진 부분 생성기 간에 공유 가중치를 적용하여, 임의의 비용 예산에서 직접 추론이 가능한 통합 생성기 훈련.
  • 단계별 훈련: 먼저 전체 채널을 사용해 다중 해상도 부분 생성기를 훈련한 후, 채널을 적응적으로 감소시킴.
  • 부분 생성기 아키텍처에 따라 자동으로 조정되는 생성기 조건부 판별기를 도입.
  • 표본 기반 다중 해상도 훈련 및 적응형 채널 훈련을 적용하여 다양한 구성 간 최적화의 안정성을 확보.
  • 전체 생성기와 부분 생성기 양쪽 모두에서 재구성 오차를 최소화하는 일관성 인식 인코더 훈련 개발.
  • 인코더 출력에서 초기화된 L-BFGS를 사용한 반복적 잠재 코드 최적화를 통해 투영 정확도 향상.

실험 결과

연구 질문

  • RQ1일관된 시각적 품질을 유지하면서 다양한 추론 비용을 지원하는 단일 GAN 생성기를 훈련시킬 수 있는가?
  • RQ2공유 가중치를 가진 다수의 부분 생성기가 최소화 최적화 프레임워크 내에서 공존할 때, 적대적 훈련을 어떻게 안정화할 수 있는가?
  • RQ3상호작용 편집 중에 부분 생성기가 전체 생성기의 미리보기 기능을 얼마나 정확하게 대체할 수 있는가?
  • RQ4일관성 인식 인코더 훈련이 다양한 생성기 구성 간 이미지 투영 정확도를 얼마나 향상시키는가?
  • RQ5CPU 및 엣지 디바이스에서 시각적 품질을 유지하면서 추론 지연에 대해 얼마나 빠른 속도 향상을 달성할 수 있는가?

주요 결과

  • Anycost GAN은 Intel Xeon CPU에서 최대 11.9×, NVIDIA Jetson Nano GPU에서 최대 8.5×의 월타임 속도 향상을 기록했으며, 시각적으로 일관된 출력을 제공한다.
  • 모델은 Xeon CPU에서 12.2×, Jetson Nano에서 8.5×의 속도 향상을 기록했으며, 캐시 효율성 덕분에 CPU에서 초선형 속도 향상을 달성했다.
  • 일관성 인식 인코더 훈련은 전체 생성기와 부분 생성기 간 재구성 오차(LPIPS) 격차를 0.07에서 0.02로 감소시켜 투영 일관성 향상을 이뤘다.
  • 이미지 편집 결과는 웃는 표정, 헤어 컬러 등 다양한 속성 변화가 전체 생성기와 부분 생성기 간에 일관되게 나타나, 구성 간 신뢰성 검증에 기여했다.
  • 이미지 품질과 일관성 측면에서 디스틸리케이션 기반 압축 및 별도의 소형 생성기 훈련보다 우수한 성능을 보였다.
  • 진화적 탐색은 다양한 계산 비용 예산 하에서 최적의 부분 생성기를 식별했으며, 높은 정밀도로 10× 이상의 계산 변동성을 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.