Skip to main content
QUICK REVIEW

[논문 리뷰] PAI-Diffusion: Constructing and Serving a Family of Open Chinese Diffusion Models for Text-to-image Synthesis on the Cloud

Chengyu Wang, Zhongjie Duan|arXiv (Cornell University)|2023. 09. 11.
Generative Adversarial Networks and Image SynthesisComputer Science인용 수 3
한 줄 요약

PAI-Diffusion는 일반 및 도메인 전용 버전을 포함한 오픈소스 중화 확산 모델의 가족을 소개한다. LoRA 및 ControlNet을 통합하여 세밀한 이미지 편집을 가능하게 하며, 중국어 웹인터페이스와 diffusers-api를 통합한 도구를 통해 스케일러블하고 클라우드 기반의 텍스트 기반 이미지 생성을 지원한다. PAI-Blade 최적화를 통해 추론 속도를 2–3배 빠르게 구현하면서도 고품질 출력을 유지한다.

ABSTRACT

Text-to-image synthesis for the Chinese language poses unique challenges due to its large vocabulary size, and intricate character relationships. While existing diffusion models have shown promise in generating images from textual descriptions, they often neglect domain-specific contexts and lack robustness in handling the Chinese language. This paper introduces PAI-Diffusion, a comprehensive framework that addresses these limitations. PAI-Diffusion incorporates both general and domain-specific Chinese diffusion models, enabling the generation of contextually relevant images. It explores the potential of using LoRA and ControlNet for fine-grained image style transfer and image editing, empowering users with enhanced control over image generation. Moreover, PAI-Diffusion seamlessly integrates with Alibaba Cloud's Machine Learning Platform for AI, providing accessible and scalable solutions. All the Chinese diffusion model checkpoints, LoRAs, and ControlNets, including domain-specific ones, are publicly available. A user-friendly Chinese WebUI and the diffusers-api elastic inference toolkit, also open-sourced, further facilitate the easy deployment of PAI-Diffusion models in various environments, making it a valuable resource for Chinese text-to-image synthesis.

연구 동기 및 목표

  • 중국어의 큰 어휘량과 복잡한 문자 수준의 종속성으로 인해 발생하는 중국어 텍스트 기반 이미지 생성의 과제를 해결하기 위해.
  • 시, 요리, 전통 예술과 같은 중국어 맥락에서의 일반 및 도메인 전용 이미지 생성을 지원하는 종합적인 프레임워크를 개발하기 위해.
  • 스타일 전이 및 편집을 위한 세밀한 제어를 가능하게 하기 위해 LoRA 및 ControlNet 통합을 통해 이미지 생성에 대한 세밀한 제어를 가능하게 하기 위해.
  • 알리바바 클라우드의 PAI 플랫폼과 오픈소스 툴킷을 통해 스케일러블하고 클라우드 네이티브 배포를 가능하게 하기 위해.
  • 모든 모델, LoRA, ControlNet, 툴킷을 오픈 라이선스 하에 공개하여 커뮤니티 협업과 혁신을 촉진하기 위해.

제안 방법

  • 다양한 중국어 텍스트-이미지 데이터셋으로 사전 훈련된 확산 모델의 가족을 활용하며, 중국 요리 및 고전 시와 같은 도메인에 특화된 변형도 포함한다.
  • LoRA(Low-Rank Adaptation)를 적용하여 효율적인 미세조정 및 스타일 전이를 가능하게 하며, 전체 모델을 재학습하지 않고도 시각적 특성을 수정할 수 있도록 한다.
  • ControlNet을 통합하여 자세, 깊이, 세그멘테이션 맵과 같은 조건 기반으로 이미지 생성을 안내함으로써 정밀한 편집 및 레이아웃 제어를 가능하게 한다.
  • diffusers-api 툴킷은 모델을 RESTful 웹 서비스로 노출하여 텍스트 기반 이미지 생성, 이미지 기반 이미지 생성, 인painting 등의 다양한 추론 작업을 지원한다.
  • AI 컴파일러인 PAI-Blade를 사용하여 추론을 최적화함으로써, 네이티브 PyTorch 대비 최대 18%까지 종단 간 지연 시간과 GPU 메모리 사용량을 감소시킨다.
  • 맞춤형 중국어 웹인터페이스 확장 기능은 중국어 프롬프트 처리 및 사용자 경험 향상을 위해 Stable Diffusion 웹인터페이스를 개선한다.

실험 결과

연구 질문

  • RQ1어떻게 하면 중국어의 언어적 복잡성, 즉 큰 어휘량과 문자 수준의 종속성을 효과적으로 다룰 수 있는가?
  • RQ2도메인 전용 미세조정은 중국어 문화적 맥락에서의 이미지 생성 관련성과 품질을 어느 정도 향상시킬 수 있는가?
  • RQ3LoRA 및 ControlNet을 효과적으로 활용하여 중국어 텍스트 기반 이미지 생성에서 스타일과 구성에 대한 세밀한 제어를 가능하게 할 수 있는가?
  • RQ4최적화된 추론을 통한 클라우드 기반 배포 방식은 중국어 확산 모델의 확장성, 성능 및 접근성에 어떤 영향을 미치는가?
  • RQ5실제 배포 환경에서 표준 PyTorch 추론 대비 컴파일러 최적화된 추론 파이프라인(PAI-Blade)의 성능 향상은 어느 정도인가?

주요 결과

  • NVIDIA A10 GPU에서 diffusers-api 툴킷은 평균 추론 시간이 2.96초를 기록하여 네이티브 PyTorch 구현 대비 2.14배 빠른 성능을 달성했다(6.34초).
  • 최적화된 diffusers-api 파이프라인을 사용할 경우 GPU 메모리 소비량은 6.94GB에서 5.56GB로 감소하여 자원 효율성이 향상됨을 확인했다.
  • 이 프레임워크는 중국 요리, 시, 전통 회화 등 다양한 도메인 전용 모델을 성공적으로 지원하여 맥락 기반의 관련성 있는 이미지 생성을 가능하게 했다.
  • LoRA 및 ControlNet은 중국어 모델에 효과적으로 통합되어 사용자가 이미지 스타일과 구조를 고정밀도로 조작할 수 있도록 했다.
  • 모델 체크포인트, LoRA, ControlNet, 툴킷(WebUI 및 diffusers-api)을 모두 오픈소스로 공개함으로써 다양한 환경에서의 광범위한 채택과 커스터마이제이션을 가능하게 했다.
  • 성능 벤치마크를 통해 PAI-Blade 최적화가 정밀도를 그대로 유지하면서도 클라우드 기반 추론에서 지연 시간과 메모리 사용량을 크게 감소시킴을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.