Skip to main content
QUICK REVIEW

[논문 리뷰] DiffStyler: Controllable Dual Diffusion for Text-Driven Image Stylization

Nisha Huang, Yuxin Zhang|arXiv (Cornell University)|2022. 11. 19.
Generative Adversarial Networks and Image Synthesis인용 수 5
한 줄 요약

DiffStyler는 텍스트 기반 이미지 스타일라이제이션을 위한 제어 가능한 이중 확산 프레임워크를 제안하며, 무작위 노이즈 대신 학습 가능한 노이즈를 사용하여 콘텐츠 구조를 유지하면서도 이중 확산 경로를 통해 스타일의 추상화와 현실감의 균형을 이룹니다. 이는 정량적·정성적 평가에서 GAN 기반 및 기준 확산 방법을 모두 능가하는 최신 기술 수준의 성능을 달성합니다.

ABSTRACT

Despite the impressive results of arbitrary image-guided style transfer methods, text-driven image stylization has recently been proposed for transferring a natural image into a stylized one according to textual descriptions of the target style provided by the user. Unlike the previous image-to-image transfer approaches, text-guided stylization progress provides users with a more precise and intuitive way to express the desired style. However, the huge discrepancy between cross-modal inputs/outputs makes it challenging to conduct text-driven image stylization in a typical feed-forward CNN pipeline. In this paper, we present DiffStyler, a dual diffusion processing architecture to control the balance between the content and style of the diffused results. The cross-modal style information can be easily integrated as guidance during the diffusion process step-by-step. Furthermore, we propose a content image-based learnable noise on which the reverse denoising process is based, enabling the stylization results to better preserve the structure information of the content image. We validate the proposed DiffStyler beyond the baseline methods through extensive qualitative and quantitative experiments. Code is available at \url{https://github.com/haha-lisa/Diffstyler}.

연구 동기 및 목표

  • 스타일 이미지를 기반으로 하는 GAN 기반 및 이미지 가이드 스타일라이제이션 방법의 한계를 해결하기 위해, 이는 예술적 표현을 제한하고 패치 반복 아티팩트를 야기합니다.
  • 확산 기반 스타일라이제이션에서 무작위 노이즈로 인해 전방 확산 과정에서 콘텐츠의 전역적 구조가 손상되는 문제를 해결합니다.
  • 스타일 이미지 참조 없이 자연어 기술을 통해 정확하고 직관적이며 유연한 스타일라이제이션을 가능하게 하여 사용자가 다양한 예술 스타일을 표현할 수 있도록 합니다.
  • 이중 확산 아키텍처를 통해 생성된 이미지에서 콘텐츠 충실도와 예술적 추상화 사이의 균형 잡힌 무게를 확보합니다.

제안 방법

  • 콘텐츠 이미지 기반의 학습 가능한 노이즈 벡터로 전방 확산 과정의 무작위 노이즈를 대체하여, 노이즈 제거 과정에서 구조적 세부 정보를 유지합니다.
  • 한 경로는 학습 가능한 노이즈를 사용해 콘텐츠 유지에 집중하고, 다른 경로는 텍스트 임bedding에 의해 가이드되는 스타일 추상화에 집중하는 이중 확산 아키텍처를 구현합니다.
  • 각 노이즈 제거 단계에서 교차 어텐션 메커니즘을 통해 텍스트 가이던스를 통합하여 단계별 스타일 제어를 가능하게 합니다.
  • 수치적 솔버를 최적화하여 샘플링 속도를 향상시키면서도 생성 품질을 유지함으로써 추론 시간을 단축합니다. 스타일라이제이션 충실도를 훼손하지 않습니다.
  • 콘텐츠 및 스타일 일치를 보장하기 위해 재구성 손실과 인지 손실을 사용하여 모델을 종합적으로 훈련합니다.
  • 계산 효율성을 향리하기 위해 잠재 공간 확산을 사용하지만, 완전한 구현은 향후 방향으로 남아 있습니다.

실험 결과

연구 질문

  • RQ1전방 확산 과정에서 무작위 노이즈를 사용할 경우, 콘텐츠 이미지의 전역적 콘텐츠 구조를 스타일라이제이션 중 효과적으로 유지할 수 있는가?
  • RQ2텍스트 기반 스타일라이제이션에서 콘텐츠 충실도와 예술적 추상화를 동시에 확보하기 위해 이중 확산 경로를 어떻게 설계할 수 있는가?
  • RQ3기본 스타일 이미지 없이 자연어 기술만으로 고품질, 다양한 스타일 및 아티팩트 없는 스타일라이제이션을 어느 정도 유도할 수 있는가?
  • RQ4다양한 스타일라이제이션 작업에서 학습 가능한 노이즈가 무작위 노이즈보다 구조적 통합성을 유지하는 데 얼마나 효과적인가?

주요 결과

  • DiffStyler는 FID, LPIPS 등의 정량적 지표와 정성적 결과 모두에서 최신 기술 수준의 성능을 달성하여 SOTA GAN 기반 및 확산 기반 기준 모델을 모두 능가합니다.
  • 모델은 얼굴 특징, 건축 윤곽선, 복잡한 질감과 같은 세밀한 콘텐츠 세부 정보를 매우 추상적이거나 예술적인 스타일에서도 성공적으로 유지합니다.
  • 실패 케이스에서는 텍스트 프롬프트에 명시적으로 언급되지 않은 요소를 생략하거나 왜곡하는 경향을 보이며, 이는 텍스트 신호에 과도하게 집중할 위험을 시사합니다.
  • 학습 가능한 노이즈의 사용은 무작위 노이즈 대비 콘텐츠 유지에 뚜렷한 향상을 보이며, 아블레이션 연구에서 LPIPS 점수가 낮고 FID 점수가 높은 결과로 이를 입증합니다.
  • 이중 확산 메커니즘은 특히 성당 창문이나 강 풍경과 같은 복잡한 구조를 가진 장면에서 더 자연스럽고 세밀한 스타일라이제이션을 가능하게 합니다.
  • 강력한 성능에도 불구하고, GAN 기반 방법보다 여전히 느리므로 잠재 공간 확산 또는 모델 정제가 향후 최적화에 유망한 방향으로 남아 있습니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.