Skip to main content
QUICK REVIEW

[논문 리뷰] EGSDE: Unpaired Image-to-Image Translation via Energy-Guided Stochastic Differential Equations

Min Zhao, Fan Bao|arXiv (Cornell University)|2022. 07. 14.
Cancer-related molecular mechanisms research인용 수 70
한 줄 요약

EGSDE는 소스 도메인과 타깃 도메인 모두에 대해 학습된 에너지 함수로 사전 학습된 점수 기반 확산 모델을 안내하여 매칭되지 않는 I2I 번역에서 더 높은 현실감과 충실성을 달성합니다. 이는 전문가들의 곱(product-of-experts) 해석을 제공하고 AFHQ와 CelebA-HQ 작업에서 충실성을 희생하지 않으면서 현실감을 최첨단으로 보여줍니다.

ABSTRACT

Score-based diffusion models (SBDMs) have achieved the SOTA FID results in unpaired image-to-image translation (I2I). However, we notice that existing methods totally ignore the training data in the source domain, leading to sub-optimal solutions for unpaired I2I. To this end, we propose energy-guided stochastic differential equations (EGSDE) that employs an energy function pretrained on both the source and target domains to guide the inference process of a pretrained SDE for realistic and faithful unpaired I2I. Building upon two feature extractors, we carefully design the energy function such that it encourages the transferred image to preserve the domain-independent features and discard domain-specific ones. Further, we provide an alternative explanation of the EGSDE as a product of experts, where each of the three experts (corresponding to the SDE and two feature extractors) solely contributes to faithfulness or realism. Empirically, we compare EGSDE to a large family of baselines on three widely-adopted unpaired I2I tasks under four metrics. EGSDE not only consistently outperforms existing SBDMs-based methods in almost all settings but also achieves the SOTA realism results without harming the faithful performance. Furthermore, EGSDE allows for flexible trade-offs between realism and faithfulness and we improve the realism results further (e.g., FID of 51.04 in Cat to Dog and FID of 50.43 in Wild to Dog on AFHQ) by tuning hyper-parameters. The code is available at https://github.com/ML-GSAI/EGSDE.

연구 동기 및 목표

  • 소스 도메인 학습 데이터를 매칭되지 않는 I2I에서 에너지 가이던스를 활용해 이용하도록 동기를 부여합니다.
  • 현실감과 충실성의 균형을 맞추기 위해 두 도메인에서 학습된 에너지 함수를 설계합니다.
  • 번역 과정에서 도메인 독립적 특성을 보존하고 도메인 특정 특성은 제거합니다.
  • EGSDE 프레임워크에 대한 전문가들의 곱(Product of Experts) 해석을 제공합니다.
  • 표준 매칭되지 않는 I2I 벤치마크에서 실험적으로 검증하고 성능 향상을 보여줍니다.

제안 방법

  • 에너지 항을 사전 학습된 SDE에 통합하는 역 시간 SDE를 통해 조건부 분포 p(y0|x0)을 형식화합니다(Eq. 6).
  • E(y,x,t)를 두 개의 로그 포텐셜의 합으로 정의합니다 E = lambda_s E_s + lambda_i E_i(Eq. 7).
  • E_s는 소스와의 유사성을 최대화하기 위해 시간 의존 도메인 특성 추출기를 사용합니다(Eq. 9).
  • E_i는 도메인 독립적 로우패스 특성 추출기를 사용하여 소스와의 차이를 벌점합니다(Eq. 10).
  • Euler-Maruyama 업데이트로 grad_y E를 포함한 에너지 가이던스 역-시간 SDE를 풉니다(Eq. 12).
  • p(y_t|x0) ≈ p_r1(y_t|x0) p_e(y_t|x0) / Z_t를 보이는 전문가들의 곱 해석을 제공하고 이를 세 전문가 시스템(Eq. 16)과 연관시킵니다(Eq. 13).

실험 결과

연구 질문

  • RQ1소스 도메인과 타깃 도메인에서 학습된 에너지 함수가 대상 도메인 확산만 사용했을 때보다 매칭되지 않는 I2I에서 현실감과 충실성을 개선할 수 있는가?
  • RQ2에너지 함수가 도메인 독립적 특성을 보존하고 도메인 특정 특성을 제거하도록 어떻게 구성되어야 하는가?
  • RQ3제안된 EGSDE 프레임워크가 표준 작업에서 SBDM 기반 및 GAN 기반의 매칭되지 않는 I2I 기준선을 능가하는가?
  • RQ4현실감과 충실성 사이의 제어 가능한 트레이드-오프를 허용하는가?
  • RQ5EGSDE를 전문가들의 곱으로 해석하는 이론적 설명이 SDE와 에너지 구성요소의 역할을 명확히 하는가?

주요 결과

  • EGSDE는 Cat→Dog, Wild→Dog, Male→Female 작업에서 현실감과 충실성 면에서 SBDMs 기반 기준선을 지속적으로 능가합니다.
  • EGSDE는 충실성을 해치지 않으면서 AFHQ 비교에서 최첨단 현실감을 달성합니다.
  • 하이퍼파라미터(lambda_s, lambda_i) 및 초기 시간 M을 조정하면 현실감-충실성의 제어 가능한 트레이드오프를 얻어 현실감 지표를 향상시킵니다.
  • SDEdit과 비교할 때 AFHQ 벤치마크에서 FID가 크게 향상되었습니다(표의 예시).
  • 사람 평가(AMT)에서 EGSDE가 기준선보다 선호된 것으로 나타났습니다.
  • 이 방법은 더 낮은 FID 점수와 경쟁력 있는 PSNR/SSIM을 보여 전반적으로 강한 이미지 품질을 입증합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.