Skip to main content
QUICK REVIEW

[논문 리뷰] Portrait Diffusion: Training-free Face Stylization with Chain-of-Painting

Jin Liu, Huaibo Huang|arXiv (Cornell University)|2023. 12. 03.
Face recognition and analysis인용 수 4
한 줄 요약

Portrait Diffusion는 사전 훈련된 텍스트-이미지 확산 모델을 활용하여 미세한 포트레이트 스타일을 파라미터 조정 없이 전달하는 훈련-free 얼굴 스타일화 프레임워크이다. 잠재 코드 역전환과 새로운 스타일 주의 제어 메커니즘을 통해 주의 공간에서 콘텐츠 및 스타일 특징을 융합하며, Chain-of-Painting을 통해 반복적인 개선을 통해 품질 향상과 다중 스타일 전이를 달성한다.

ABSTRACT

Face stylization refers to the transformation of a face into a specific portrait style. However, current methods require the use of example-based adaptation approaches to fine-tune pre-trained generative models so that they demand lots of time and storage space and fail to achieve detailed style transformation. This paper proposes a training-free face stylization framework, named Portrait Diffusion. This framework leverages off-the-shelf text-to-image diffusion models, eliminating the need for fine-tuning specific examples. Specifically, the content and style images are first inverted into latent codes. Then, during image reconstruction using the corresponding latent code, the content and style features in the attention space are delicately blended through a modified self-attention operation called Style Attention Control. Additionally, a Chain-of-Painting method is proposed for the gradual redrawing of unsatisfactory areas from rough adjustments to fine-tuning. Extensive experiments validate the effectiveness of our Portrait Diffusion method and demonstrate the superiority of Chain-of-Painting in achieving precise face stylization. Code will be released at \url{https://github.com/liujin112/PortraitDiffusion}.

연구 동기 및 목표

  • 각 새로운 스타일에 대해 시간이 오래 걸리고 저장소를 많이 차지하는 미세 조정이 필요한 기존 얼굴 스타일화 방법의 한계를 해결한다.
  • 얼굴 정체성과 헤어 텍스처, 눈썹 그림자와 같은 국소적 세부 사항을 유지하면서 정밀한 미세 스타일 전이를 가능하게 한다.
  • 재학습 없이도 임의의 기준 포트레이트를 사용해 영역을 자유롭게 스타일 전이할 수 있는 제로샷 프레임워크를 개발한다.
  • 불만족스러운 영역을 개선하고 다양한 얼굴 특징에 대해 다중 스타일 스타일 전이를 가능하게 하는 점진적 개선 파라다임을 도입한다.

제안 방법

  • 콘텐츠 및 스타일 표현을 위해 DDIM 역전환을 사용해 소스 및 기준 얼굴 이미지를 잠재 코드로 변환한다.
  • 표준 자기주의 주의를 스타일 주의 제어로 대체하여 이중 분지 교차주의를 활용해 모odulated 융합 비율을 통해 콘텐츠 및 스타일 특징을 융합한다.
  • 질의 혼동을 줄이기 위해 소스 및 기준 마스크를 사용해 의미적으로 일치하는 영역로 주의를 제한하는 마스크 프롬프트 스타일 주의 제어를 도입한다.
  • 특성별 마스크를 사용해 특정 얼굴 영역에 대해 스타일 전이를 반복적으로 적용하는 순차적 개선 프로세스인 Chain-of-Painting을 구현한다.
  • 주의 메커니즘 내 융합 비율을 조절하는 스타일 가이던스 스케일을 통해 스타일 전이 강도를 제어한다.
  • Chain-of-Painting에서 타겟 영역 개선을 위한 얼굴 특징 맵 선택을 인간 피드백을 기반으로 유도한다.

실험 결과

연구 질문

  • RQ1훈련 없이 사전 훈련된 확산 모델을 미세 조정 없이 고해상도의 정밀한 포트레이트 스타일화를 달성할 수 있는가?
  • RQ2어떻게 주의 공간에서 콘텐츠 및 스타일 특징을 효과적으로 융합하여 얼굴 정체성을 유지하면서도 복잡한 예술적 스타일을 전달할 수 있는가?
  • RQ3반복적이고 영역별로 특정된 개선이 단일 생성 방식을 초월해 스타일화 품질을 향상시킬 수 있는가?
  • RQ4단일 프레임워크를 사용해 한 번의 이미지에 서로 다른 얼굴 특징에 대해 여러 개의 독립된 포트레이트 스타일을 적용할 수 있는가?
  • RQ5제안된 방법은 미세 조정 기반 최신 기술 대비 사용자 선호도와 효율성 측면에서 어떻게 비교되는가?

주요 결과

  • 사용자 평가에서 Portrait Diffusion는 30.26%의 사용자 선호도를 기록하여 다음으로 우수한 방법인 JoJoGAN(20.52%)을 크게 앞서며 뚜렷한 승리를 거두었다.
  • 다른 방법들이 48.52초에서 2000초 이상의 훈련 시간이 필요로 하는 데 반해, 이 방법은 훈련 시간이 0초로 전혀 소요되지 않았다.
  • 시각적 아블레이션 결과에서 스타일 주의 제어를 제거할 경우 심각한 의미 왜곡과 아티팩트가 발생하여, 콘텐츠 무결성을 유지하는 데서의 역할을 확인했다.
  • Chain-of-Painting은 불만족스러운 영역의 효과적인 개선을 가능하게 하여 헤어 텍스처와 눈썹 그림자와 같은 국소적 세부 사항을 향상시키면서도 정체성을 유지했다.
  • Chain-of-Painting에서 여러 기준 이미지와 마스크를 사용해 다양한 얼굴 특징(예: 머리카락은 한 스타일, 눈은 다른 스타일)에 대해 다중 스타일 전이를 성공적으로 수행했다.
  • VCT 및 InST와 같은 확산 기반 기준 모델과 비교했을 때, Portrait Diffusion는 특히 표정이나 복잡한 텍스처가 있는 어려운 케이스에서 더 뛰어난 콘텐츠 일관성과 스타일 충실도를 유지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.