[논문 리뷰] CycleNet: Rethinking Cycle Consistency in Text-Guided Diffusion for Image Manipulation
CycleNet는 텍스트 지도 확산 모델에서 쌍방향 번역 사이클의 일致성을 강제하는 단순하면서도 효과적인 방법을 제안한다. 제안된 방법은 ControlNet 기반의 임베딩 확산 백본과 정방향 및 역방향 번역 사이클 간의 일致성 정규화를 사용한다. 이는 최소한의 데이터(약 2,000개 샘플)와 1개의 GPU로도 상태의 최고 성능을 달성하며, 프롬프트 변경을 통해 도메인 외 분포로의 제로샷 일반화를 가능하게 한다.
Diffusion models (DMs) have enabled breakthroughs in image synthesis tasks but lack an intuitive interface for consistent image-to-image (I2I) translation. Various methods have been explored to address this issue, including mask-based methods, attention-based methods, and image-conditioning. However, it remains a critical challenge to enable unpaired I2I translation with pre-trained DMs while maintaining satisfying consistency. This paper introduces Cyclenet, a novel but simple method that incorporates cycle consistency into DMs to regularize image manipulation. We validate Cyclenet on unpaired I2I tasks of different granularities. Besides the scene and object level translation, we additionally contribute a multi-domain I2I translation dataset to study the physical state changes of objects. Our empirical studies show that Cyclenet is superior in translation consistency and quality, and can generate high-quality images for out-of-domain distributions with a simple change of the textual prompt. Cyclenet is a practical framework, which is robust even with very limited training data (around 2k) and requires minimal computational resources (1 GPU) to train. Project homepage: https://cyclenetweb.github.io/
연구 동기 및 목표
- 사전 훈련된 확산 모델을 사용하여 쌍방향이 아닌 설정에서 일관성 없는 이미지 간 번역 문제를 해결하기 위해.
- 쌍방향 데이터나 복잡한 어텐션/마스크 감시 없이도 번역 정확도와 구조적 일관성을 향상시키기 위해.
- 간단한 프롬프트 엔지니어링을 통해 재학습 없이도 도메인 외 분포로의 강건한 제로샷 일반화를 가능하게 하기 위해.
- 제한된 데이터(약 2,000개 샘플)와 최소한의 하드웨어(1개 GPU)로도 효과적으로 훈련 가능한 계산 효율성이 높은 프레임워크를 개발하기 위해.
- 물리적 상태 변화를 연구하기 위한 새로운 다중 도메인 데이터셋인 ManiCups를 제작하기 위해.
제안 방법
- CycleNet는 사전 훈련된 Stable Diffusion 백본과 ControlNet 기반 아키텍처를 사용하여 입력 이미지와 텍스트 프롬프트에 조건화된 이미지 간 번역을 수행한다.
- 모델이 원본 이미지를 목표 도메인으로의 정방향 번역 후 다시 원래 도메인으로의 역방향 번역을 거쳐 원래 이미지를 재구성하도록 하여 사이클 일관성을 강제한다.
- 원본 입력과 사이클 재구성된 이미지 간의 재구성 손실을 최소화함으로써 번역 과정을 정규화하여 구조적 및 의미적 일관성을 확보한다.
- 확산 과정의 노이즈 제거 손실과 사이클 일관성 손실을 결합한 훈련 목표를 사용하여 안정적이고 고품질의 생성을 가능하게 한다.
- 단순히 텍스트 프롬프트를 변경하기만 하면 제로샷 추론을 지원하여 재학습 없이도 새로운 도메인으로의 일반화가 가능하다.
- 최소한의 추가 파rameter와 계산 비용으로도 작동하는 경량 어댑터 메커니즘을 사용한다.

실험 결과
연구 질문
- RQ1텍스트 지도 확산 모델에 대해 쌍방향 번역 사이클의 일관성이 이미지 간 번역의 일관성과 품질 향상에 효과적으로 적용될 수 있는가?
- RQ2기존의 마스크 기반 및 마스크 없는 확산 방법과 비교할 때, CycleNet의 번역 정확도와 구조적 일관성은 어떠한가?
- RQ3프롬프트 수정만으로 CycleNet이 도메인 외 분포로 얼마나 잘 일반화되는가?
- RQ4CycleNet이 고품질 결과를 달성하기 위해 필요한 최소한의 데이터와 계산 비용은 얼마인가?
- RQ5액체가 용기에 채워지는 등의 물리적 상태 변화를 모델링하는 데서 CycleNet의 효과성은 어떠한가?
주요 결과
- Empty-to-juice 번역 작업에서 FID(79.02)와 FID-clip(23.42) 점수가 가장 낮아, CycleDiffusion 및 Text2LIVE를 포함한 모든 베이스라인을 압도한다.
- 저자원(empty-to-milk 및 empty-to-water) 번역 작업에서 각각 FID 점수 97.07과 95.97을 기록하여 경쟁 방법보다 유의미하게 낮다.
- Empty-to-juice 작업에서 CLIP 점수 27.75를 기록하여 목표 도메인과 뛰어난 의미 일치를 보인다.
- 단지 2,000개의 훈련 샘플과 1개의 GPU로도 강력한 성능 유지를 보이며, 높은 데이터 및 계산 효율성을 입증한다.
- 제로샷 일반화 능력이 뛰어나, 단지 프롬프트를 변경하기만 하면 도메인 외 분포에 대해서도 고품질 이미지를 생성한다.
- 정성적 결과에서 CycleNet은 복잡한 물체 상태 변화에서 특히 세부 사항과 구조적 일관성을 잘 유지함을 확인하였으며, ManiCups 데이터셋을 통해 검증되었다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.