Skip to main content
QUICK REVIEW

[논문 리뷰] Dual Diffusion Implicit Bridges for Image-to-Image Translation

Xuan Su, Jiaming Song|arXiv (Cornell University)|2022. 03. 16.
Generative Adversarial Networks and Image Synthesis인용 수 13
한 줄 요약

이 논문은 이중 확산 암시 브리지(Dual Diffusion Implicit Bridges, DDIBs)를 제안하며, 이는 소스 도메인과 타겟 도메인 각각에 대해 독립적으로 훈련된 두 개의 확산 모델을 사용하여 훈련을 분리함으로써, 병행된 데이터 접근 없이도 개인정보 보호가 가능한 쌍방향 번역을 가능하게 하는 새로운 이미지 간 번역 방법이다. 이 방법은 확률 흐름 상미분방정식(ODE)을 활용해 이미지를 공통 잠재 공간으로 매핑하고 타겟 도메인 이미지를 재구성하며, 해법 이산화 오차 수준까지 사이클 일致성을 달성하고, 이 과정을 슈뢰딩거 브리지(Schrödinger Bridges)를 통한 엔트로피 정규화된 최적 운반 이론(optimal transport)로 이론적으로 기반화한다.

ABSTRACT

Common image-to-image translation methods rely on joint training over data from both source and target domains. The training process requires concurrent access to both datasets, which hinders data separation and privacy protection; and existing models cannot be easily adapted for translation of new domain pairs. We present Dual Diffusion Implicit Bridges (DDIBs), an image translation method based on diffusion models, that circumvents training on domain pairs. Image translation with DDIBs relies on two diffusion models trained independently on each domain, and is a two-step process: DDIBs first obtain latent encodings for source images with the source diffusion model, and then decode such encodings using the target model to construct target images. Both steps are defined via ordinary differential equations (ODEs), thus the process is cycle consistent only up to discretization errors of the ODE solvers. Theoretically, we interpret DDIBs as concatenation of source to latent, and latent to target Schrodinger Bridges, a form of entropy-regularized optimal transport, to explain the efficacy of the method. Experimentally, we apply DDIBs on synthetic and high-resolution image datasets, to demonstrate their utility in a wide variety of translation tasks and their inherent optimal transport properties.

연구 동기 및 목표

  • 쌍방향 소스 및 타겟 데이터 세트에 대한 동시 훈련이 필요로 하는 기존의 비쌍방향 이미지 번역 방법의 한계를 해결하기 위해.
  • 훈련 중 소스 도메인 및 타겟 도메인 데이터에 동시에 접근할 필요 없이 데이터 프라이버시를 보장할 수 있도록 하기 위해.
  • 사전 훈련된 도메인 전용 확산 모델을 다양한 번역 작업에 재사용할 수 있도록 모델의 적응성을 향상시키기 위해.
  • 특히 슈뢰딩거 브리지에 기반한 최적 운반 원리에 기반한 이론적으로 탄탄한 이미지 번역 프레임워크를 제공하기 위해.
  • 도메인 전용 미세조정 없이도 높은 품질의 번역을 달성하고, 사이클 일치성과 최적 운반 효율성을 내재적으로 확보할 수 있도록 하기 위해.

제안 방법

  • DDIBs는 소스 도메인과 타겟 도메인 각각에 대해 사전 훈련된 독립적인 두 개의 확산 모델을 사용하며, 각각의 데이터 세트에서 별도로 훈련된다.
  • 이 방법은 소스 모델에서 정방향 확률 흐름 ODE를 적용하여 소스 이미지를 잠재 표현으로 매핑함으로써 내용 구조를 유지한다.
  • 그 다음, 타겟 모델의 역방향 확률 흐름 ODE를 사용해 잠재 코드에서 타겟 도메인 이미지를 재구성함으로써 번역을 완료한다.
  • 전체 과정은 두 개의 ODE로 정의되며, 하나는 소스에서 잠재 공간으로의 매핑을, 다른 하나는 잠재 공간에서 타겟으로의 재구성에 해당하며, 모두 소음 제거 확산 암시 모델(DDIMs)에서 유도된다.
  • 번역 과정은 두 개의 슈뢰딩거 브리지 문제의 연결으로 간주되며, 하나는 소스에서 잠재 공간으로, 다른 하나는 잠재 공간에서 타겟으로의 매핑이며, 특이하거나 선형적인 드리프트를 가지므로 최적 운반 이론에 이론적 기반을 제공한다.
  • 사이클 일치성은 ODE 해법기의 수치 이산화 오차 수준까지 달성되며, 이미지를 완전히 왕복 번역해도 원본 이미지가 해법기의 정밀도 내에서 복원됨을 보장한다.

실험 결과

연구 질문

  • RQ1쌍방향 소스 및 타겟 데이터에 대한 동시 훈련 없이도 개인정보 보호가 가능한 이미지 간 번역이 가능할 수 있는가?
  • RQ2도메인 전용 확산 모델을 재훈련 없이도 여러 번역 작업에 재사용할 수 있는 방법은 무엇인가?
  • RQ3DDIBs와 최적 운반 이론, 특히 슈뢰딩거 브리지 간의 이론적 연결 고리는 무엇인가?
  • RQ4DDIBs는 어느 정도 사이클 일치성을 달성하며, 이는 ODE 해법기 정확도와 어떻게 관련이 있는가?
  • RQ5DDIBs는 기존의 GAN 기반 및 플로우 기반 방법보다 번역 품질에서 뛰어나면서도 계산 및 프라이버시 우월성을 유지할 수 있는가?

주요 결과

  • DDIBs는 합성 및 고해상도 데이터 세트에서 높은 품질의 이미지 번역을 달성하며, 사전 훈련된 조건부 확산 모델을 사용해 호랑이에서 고양이로의 이미지 간 번역도 성공적으로 수행한다.
  • 이 방법은 ODE 해법기의 이산화 오차 수준까지 내재된 사이클 일치성을 보이며, 왕복 번역 시 이미지의 품질 저하가 최소한이 된다.
  • DDIBs는 특이한 슈뢰딩거 브리지 문제의 해로서 이론적으로 탄탄하며, 엔트로피 정규화된 최적 운반 이론과 연결되어 있어, 경험적 손실 최소화 방식의 보다 원칙적인 대안을 제공한다.
  • 훈련 중 소스 및 타겟 데이터 세트를 동시에 접근할 필요 없이 개인정보 보호가 가능하게 하여 번역 과정을 보다 안전하게 만든다.
  • 모델 저장 및 훈련 오버헤드를 크게 줄여, 도메인 수에 비례해 선형적인 모델 수(도메인당 하나)만 필요로 하여, 이전의 이차적 모델 수 요구 방식보다 훨씬 뛰어난 적응성과 효율성을 확보한다.
  • 스타일 전이 및 이미지 복원과 같은 다양한 번역 작업에서 뛰어난 성능을 보이며, 최첨단의 동시 훈련 기반 접근 방식과 비교해도 유사한 결과를 얻는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.