Skip to main content
QUICK REVIEW

[논문 리뷰] Guided Image-to-Image Translation with Bi-Directional Feature Transformation

Badour AlBahar, Jia‐Bin Huang|arXiv (Cornell University)|2019. 10. 24.
Advanced Vision and Imaging참고 문헌 38인용 수 16
한 줄 요약

이 논문은 입력 이미지와 가이던스 이미지 간의 상호 정보 흐름을 가능하게 하는 이방향 특징 변환(bi-directional feature transformation, bFT) 기법을 제안한다. 이는 공간적으로 변화하는 특징 기반 아핀 변환을 통해 지도형 이미지 간 번역을 실현한다. 이 방법은 포즈 전이, 텍스처 전이, 깊이 업샘플링 작업에서 기존의 단방향 조건부 방법(예: 연결, CIN, AdaIN)보다 정량적 지표와 사용자 연구에서 모두 뛰어난 성능을 기록하며 최신 기술 수준 또는 경쟁 가능한 성능을 달성한다.

ABSTRACT

We address the problem of guided image-to-image translation where we translate an input image into another while respecting the constraints provided by an external, user-provided guidance image. Various conditioning methods for leveraging the given guidance image have been explored, including input concatenation , feature concatenation, and conditional affine transformation of feature activations. All these conditioning mechanisms, however, are uni-directional, i.e., no information flow from the input image back to the guidance. To better utilize the constraints of the guidance image, we present a bi-directional feature transformation (bFT) scheme. We show that our bFT scheme outperforms other conditioning schemes and has comparable results to state-of-the-art methods on different tasks.

연구 동기 및 목표

  • 지난 번역에서 단방향 조건부 방법이 가이던스 이미지의 영향만을 받는 한계를 해결하기 위해.
  • 입력 이미지에서 가이던스 이미지로의 정보 흐름을 허용함으로써 이미지 번역의 제어성과 시각적 품질을 향상시키기 위해.
  • 다양한 가이던스 유형(예: 포즈, 텍스처, 깊이, 마스크)에 일반화 가능한 응용 프로그램에 종속되지 않는 조건부 메커니즘을 개발하기 위해.
  • 특징 변환을 공간적으로 변화시키어 입력 이미지와 가이던스 이미지의 콘텐츠 차이에 국소적으로 적응할 수 있도록 하기 위해.
  • 작업 특화 아키텍처 수정 없이도 다양한 이미지 번역 작업에서 제안된 방법의 효과성을 검증하기 위해.

제안 방법

  • 가이던스에서 입력으로, 그리고 입력에서 가이던스로의 양방향으로 특징 기반 아핀 변환을 적용하는 이방향 특징 변환(bFT) 메커니즘을 제안한다.
  • 입력 및 가이던스 특징에 조건화된 경량 네트워크를 통해 공간적으로 변화하는 스케일링 및 시프팅 파라미터를 도입한다.
  • U-Net 기반 생성자에서 표준 정규화 레이어를 bFT 레이어로 교체하여, 소스 및 가이던스 콘텐츠에 기반한 특징 맵의 동적 조절을 가능하게 한다.
  • 입력 및 가이던스 이미지를 인코딩하기 위한 공통 특징 추출기를 사용한 후, 교차 attention 또는 요소별 상호작용을 통해 조절 파라미터를 생성한다.
  • bFT 레이어를 각 잔여 블록에 배치한 잔여 U-Net 아키텍처를 사용하며, 배치 정규화나 인스턴스 정규화 레이어를 대체한다.
  • bFT 연산을 다음과 같이 적용한다: $ y = \gamma(x, g) \odot \text{BatchNorm}(x) + \beta(x, g) $, 여기서 $ \gamma $ 및 $ \beta $ 는 $ x $ (입력) 및 $ g $ (가이던스)에서 예측된 공간적으로 변화하는 파라미터이다.

실험 결과

연구 질문

  • RQ1입력 이미지와 가이던스 이미지 간의 이방향 정보 흐름이 이미지 간 번역의 품질과 제어성 향상에 기여하는가?
  • RQ2공간적으로 변화하는 특징 변환은 공간적으로 불변인 방법에 비해 가이던스 신호의 국소화 및 적응에 더 나은 성능을 보이는가?
  • RQ3기존의 조건부 메커니즘(예: 연결, CIN, AdaIN)과 비교해 본 논문의 bFT 기법은 정량적 지표와 사용자 선호도 측면에서 어떻게 성능을 냈는가?
  • RQ4한 개의 일반적인 bFT 기반 모델이 작업 특화 아키텍처 수정 없이 다양한 지도형 번역 작업에서 경쟁 가능한 성능을 달성할 수 있는가?
  • RQ5성능과 효율성을 균형 잡기 위해 네트워크 내에서 bFT 레이어의 최적의 수와 배치는 무엇인가?

주요 결과

  • 제안된 bFT 방법은 깊이 업샘플링(16배)에서 FID 13.240을 기록하며, 입력 연결(FID: 11.86), 특징 연결(FID: 11.59), 단방향 FT(FID: 13.988)를 모두 초월한다.
  • 포즈 전이 작업에서 bFT는 SSIM 0.767과 FID 13.240을 기록하며, 단방향 FT(SSIM: 0.765, FID: 13.988)와 입력 연결(SSIM: 0.782, FID: 42.330)보다 뚜렷이 뛰어나다.
  • 텍스처 전이 작업에서 bFT는 FID 58.467과 LPIPS 0.067을 기록하며, 입력 연결(FID: 60.795, LPIPS: 0.061)과 특징 연결(FID: 44.900, LPIPS: 0.085)을 모두 능가한다.
  • 사용자 연구 결과, 85.6%의 참가자가 bFT로 생성된 이미지가 더 현실적이며 가이던스에 더 잘 부합한다고 평가하여 최신 기술 수준의 방법보다 선호되었다.
  • 절단 연구 결과, 모든 네 개의 잔여 블록에 bFT를 적용할 경우 최고의 성능을 기록하였으며, 깊이 업샘플링에서 FID 13.240을 기록했고, 단방향 FT를 사용한 경우 FID 13.988이었다.
  • 최종 정규화 레이어를 bFT로 교체할 경우 CIN 또는 AdaIN을 최종 레이어에 적용한 경우(FID: 157.335 및 168.503)보다 더 좋은 결과(FID: 13.240)를 기록하여 제안된 bFT 설계의 우수성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.