Skip to main content
QUICK REVIEW

[논문 리뷰] Interpolating between Images with Diffusion Models

Clinton Wang, Polina Golland|arXiv (Cornell University)|2023. 07. 24.
Generative Adversarial Networks and Image SynthesisComputer Science인용 수 3
한 줄 요약

이 논문은 사전 훈련된 잠재 확산 모델을 사용하여 실사 이미지 간에 고품질이고 의미적으로 유의미한 전환을 가능하게 하는 제로샷 이미지 보간 방법을 제안한다. 다양한 스타일, 레이아웃, 주제를 가진 실사 이미지 간에 전환을 구현하며, 점점 감소하는 노이즈 수준에서 잠재공간에서 보간하고, 보간된 텍스트 임베딩과 선택적 자세 가이던스에 조건을 주어, 시각적으로 일관된 시퀀스를 생성한다. 이는 FID와 PPL과 같은 표준 지표보다 더 창의적인 의미 전환을 선호하는 결과를 낳는다.

ABSTRACT

One little-explored frontier of image generation and editing is the task of interpolating between two input images, a feature missing from all currently deployed image generation pipelines. We argue that such a feature can expand the creative applications of such models, and propose a method for zero-shot interpolation using latent diffusion models. We apply interpolation in the latent space at a sequence of decreasing noise levels, then perform denoising conditioned on interpolated text embeddings derived from textual inversion and (optionally) subject poses. For greater consistency, or to specify additional criteria, we can generate several candidates and use CLIP to select the highest quality image. We obtain convincing interpolations across diverse subject poses, image styles, and image content, and show that standard quantitative metrics such as FID are insufficient to measure the quality of an interpolation. Code and data are available at https://clintonjwang.github.io/interpolation.

연구 동기 및 목표

  • 현재의 이미지 생성 파이프라인에서 부족한, 스타일, 콘텐츠, 레이아웃 면에서 큰 차이가 나는 실사 이미지 간에 고품질이고 의미적으로 의미 있는 보간을 가능하게 하기 위해.
  • 특히 얼굴와 같은 제한된 도메인 외의 실사 이미지에 대해 기존 보간 방법의 사용자 제어력과 일관성 부족 문제를 해결하기 위해.
  • 세부 조정 없이 사전 훈련된 잠재 확산 모델을 활용하여 다양한 이미지 쌍에 대해 제로샷 배포가 가능한 방법을 개발하기 위해.
  • 표준 지표인 FID와 PPL이 보간의 인지적 품질과 창의성 측면을 포착하지 못함을 입증하고, 새로운 평가 체계가 필요함을 보여주기 위해.

제안 방법

  • 확산 과정에서 여러 노이즈 수준에서 두 입력 이미지의 잠재 표현을 보간하고, 균일하거나 비균일한 스케줄을 사용하여 인지적 전환 속도를 제어한다.
  • 텍스트 인버전을 통해 유도된 보간된 텍스트 임베딩에 조건을 주어, 화면 간 의미 일관성을 확보하는 디노이징 U-Net을 사용한다.
  • 선택적으로 주제 자세 임베딩을 통합하여, 특히 인간이나 인간형 주제의 경우 구조적 일관성을 유지한다.
  • 다양한 노이즈 벡터를 사용해 각 프레임에 대해 여러 후보 보간을 생성하고, 원하는 프om프트와의 CLIP 유사도를 기반으로 최고 품질의 출력을 선택한다.
  • 다단계 디노이징 전략을 적용하여 중간 타임스텝에서 보간하고 반복적으로 디노이징함으로써 부드러움과 의미 정확도를 향상시킨다.
  • 보간 전에 잠재공간에 애핀 변환을 적용하여 줌인, 편향 등의 운동 효과를 시뮬레이션하고, 영상 유사 시퀀스로의 확장을 가능하게 한다.
Figure 2: Our pipeline. To generate a new frame, we interpolate the noisy latent images of two existing frames (Section 4.1 ). Text prompts and (if applicable) poses are extracted from the original input images, and interpolated to provide to the denoiser as conditioning inputs (Section 4.2 and 4.3
Figure 2: Our pipeline. To generate a new frame, we interpolate the noisy latent images of two existing frames (Section 4.1 ). Text prompts and (if applicable) poses are extracted from the original input images, and interpolated to provide to the denoiser as conditioning inputs (Section 4.2 and 4.3

실험 결과

연구 질문

  • RQ1사전 훈련된 잠재 확산 모델은 미세조정 없이도 스타일과 레이아웃이 다양하지만 실사 이미지 간에 고품질이고 의미적으로 일관된 보간을 생성할 수 있는가?
  • RQ2보간된 텍스트 및 자세 임베딩에 조건을 주는 것이 이미지 보간의 품질과 일관성에 어떤 영향을 미치는가?
  • RQ3왜 FID와 PPL과 같은 표준 지표는 이미지 보간 작업에서 인간의 선호도와 상관관계가 없는가?
  • RQ4다단계 디노이징과 CLIP 기반 후보 선택은 보간의 시각적 품질과 일관성을 향상시키는가?
  • RQ5보간 스케줄의 선택(균일 vs. 비균일)이 인지적 부드러움과 사용자 인식에 어떤 영향을 미치는가?

주요 결과

  • 제안된 방법은 인간에서 산으로, 만화에서 실사 사진으로, 다양한 자세로의 전환 등 다양한 이미지 쌍 간에 현실적으로 설득력 있는 보간을 생성한다. 의미적 차이가 크더라도 성공적으로 작동한다.
  • 공유된 노이즈를 사용하고 다단계 디노이징(노이즈 추가-보간-디노이징) 전략을 적용한 경우, PPL이 가장 높았고(193 ± 27), 시각적으로도 가장 선호되었지만, FID 측면에선 최적은 아니었다.
  • FID와 PPL 지표는 단순한 알파 블렌딩 유사 보간을 선호하며, 이는 더 창의적이거나 부드럽지 못한 결과를 낳는다. 이는 현재의 지표들이 보간 품질 평가에 부적절하다는 것을 시사한다.
  • CLIP 기반 후보 선택은 낮은 유사도 또는 일관성 없는 프레임을 걸러내어 의미 일관성을 향상시키며, 출력 품질을 크게 향상시켰다.
  • 비균일한 보간 스케줄은 특히 입력 이미지 근처에서 급격한 스타일 변화가 발생할 경우 인지적 속도를 더 잘 제어할 수 있어, 전환의 역학에 대한 사용자 제어를 향상시킨다.
  • 메서드는 극단적인 스타일 불일치나 복잡한 물체 재구성 상황에서는 일반화에 실패할 수 있으며, 자세 가이던스가 있더라도 가짜 텍스트를 삽입하거나 신체 부위를 잘못 정렬하는 경우가 있다.
Figure 3: Pose conditioning mitigates the occurrence of abrupt pose changes between adjacent frames, even when the predicted pose is incorrect.
Figure 3: Pose conditioning mitigates the occurrence of abrupt pose changes between adjacent frames, even when the predicted pose is incorrect.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.