[논문 리뷰] Zero-shot Image-to-Image Translation
이 논문은 사전 훈련된 텍스트-이미지 확산 모델을 사용하여 실사 이미지를 제로샷으로 편집할 수 있는 훈련-무료, 프롬프트-무료 이미지 간 번역 방법인 pix2pix-zero를 제안한다. CLIP 임베딩 공간에서 편집 방향을 자동으로 탐지하고, 입력 구조를 유지하기 위해 교차-어텐션 가이던스를 적용함으로써, 미세조정이나 수동 프롬프트 없이도 콘텐츠 보존 및 사진처럼 사실적인 성능을 달성한다.
Large-scale text-to-image generative models have shown their remarkable ability to synthesize diverse and high-quality images. However, it is still challenging to directly apply these models for editing real images for two reasons. First, it is hard for users to come up with a perfect text prompt that accurately describes every visual detail in the input image. Second, while existing models can introduce desirable changes in certain regions, they often dramatically alter the input content and introduce unexpected changes in unwanted regions. In this work, we propose pix2pix-zero, an image-to-image translation method that can preserve the content of the original image without manual prompting. We first automatically discover editing directions that reflect desired edits in the text embedding space. To preserve the general content structure after editing, we further propose cross-attention guidance, which aims to retain the cross-attention maps of the input image throughout the diffusion process. In addition, our method does not need additional training for these edits and can directly use the existing pre-trained text-to-image diffusion model. We conduct extensive experiments and show that our method outperforms existing and concurrent works for both real and synthetic image editing.
연구 동기 및 목표
- 사전 훈련된 텍스트-이미지 확산 모델을 사용해 실사 이미지를 편집하는 데 있어, 번거로운 수동 프롬프트 입력과 자주 발생하는 입력 구조 보존 실패 문제를 해결하기 위해.
- 이미지 간 번역에서 작업별 미세조정이나 이미지별 텍스트 프롬프트가 필요 없도록 하기 위해.
- 레이아웃, 객체 자세, 배경 세부 정보를 유지하면서 다양한 실사 및 합성 이미지를 제로샷으로 편집할 수 있도록 하기 위해.
- 추가 훈련이나 비용이 많이 드는 역전환 과정 없이도 기존 사전 훈련된 모델을 활용할 수 있는 방법을 개발하기 위해.
제안 방법
- 소스 도메인 및 타겟 도메인 용어의 문장 임베딩(예: '고양이' 대비 '개') 간 평균 차이를 계산하여 CLIP 임베딩 공간에서 편집 방향을 자동으로 탐지한다.
- 자기상관관계 정규화를 적용한 결정론적 DDIM 역전환을 사용하여 노이즈가 가우시안에 가까워지도록 보장함으로써, 역전환 품질과 안정성을 향상시킨다.
- 확산 샘플링 중에 입력 이미지의 교차-어텐션 맵을 유지하기 위해 교차-어텐션 가이던스를 적용함으로써, 구조 일致성을 유지한다.
- 미세조정 없이도 사전 훈련된 텍스트-이미지 확산 모델을 직접 활용하여, 새로운 편집 작업에 제로샷 적응이 가능하도록 한다.
- 쌍체의 실사-편집된 이미지 데이터를 사용하여 고해상도 확산 모델 출력을 빠른 조건부 GAN으로 정제함으로써 실시간 추론을 가능하게 한다.
실험 결과
연구 질문
- RQ1각 입력 이미지에 대해 수동 텍스트 프롬프트가 필요 없이 CLIP 임베딩 공간에서 편집 방향을 자동으로 탐지할 수 있는가?
- RQ2확산 과정 중 교차-어텐션 맵의 일관성이 입력 이미지의 구조 레이아웃을 유지하는 데 기여하는가?
- RQ3훈련-무료, 프롬프트-무료 방법이 기존의 제로샷 및 미세조정 기반 접근법에 비해 더 뛰어난 콘텐츠 보존 및 사진적 사실성 성능을 달성할 수 있는가?
- RQ4문장 기반의 편집 방향 탐지와 교차-어텐션 가이던스의 조합이 객체 자세와 배경 충실도를 유지하는 데 얼마나 효과적인가?
주요 결과
- 제안된 방법은 가장 높은 CLIP-Accuracy(0.87)를 기록하면서도 가장 낮은 구조 거리(0.04)와 BG LPIPS(0.05)를 유지하여, 뛰어난 편집 일관성과 콘텐츠 보존 능력을 입증한다.
- 교차-어텐션 가이던스는 구조 유지에 크게 기여하여, 이 구성 요소가 없는 변형 대비 구조 왜곡과 배경 오류를 감소시킨다.
- SDEdit 및 DDIM + 단어 교체 방법과 비교해도, 특히 객체 교체나 스타일 전이와 같은 복잡한 편집 작업에서 사진적 사실성과 콘텐츠 보존 능력 면에서 모두 뛰어나다.
- 조건부 GAN 정제를 통해 추론 속도가 약 3,800배 향상되어 소비자 하드웨어에서도 실시간 편집이 가능해졌다.
- 이 방법은 고양이 → 개로의 객체 교체, 안경 추가와 같은 속성 편집, 스케치 → 올리브 페인트 스타일 전이 등 다양한 실사 및 합성 이미지에서 뛰어난 안정성을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.