Skip to main content
QUICK REVIEW

[논문 리뷰] A Novel BiLevel Paradigm for Image-to-Image Translation

Liqian Ma, Qianru Sun|arXiv (Cornell University)|2019. 04. 18.
Generative Adversarial Networks and Image Synthesis참고 문헌 50인용 수 5
한 줄 요약

이 논문은 이미지 간 번역에 대해 소수의 흐름 데이터로 새로운 환경에 빠르게 적응할 수 있도록 일반 목적(GP) 모델과 개별 사례(IS) 모델을 번갈아가며 훈련하는 새로운 양자역학(BiLevel, BiL) 학습 프레임워크를 제안한다. IS 모델을 GP 모델의 가중치로 초기화하고 유사한 환경에서 보조 미세조정을 통해 이미지 품질과 정체성 유지 능력을 크게 향상시켜, 얼굴 및 스트리트 뷰 데이터셋에서 PG 2 및 Pix2Pix와 같은 기준 모델을 능가한다.

ABSTRACT

Image-to-image (I2I) translation is a pixel-level mapping that requires a large number of paired training data and often suffers from the problems of high diversity and strong category bias in image scenes. In order to tackle these problems, we propose a novel BiLevel (BiL) learning paradigm that alternates the learning of two models, respectively at an instance-specific (IS) and a general-purpose (GP) level. In each scene, the IS model learns to maintain the specific scene attributes. It is initialized by the GP model that learns from all the scenes to obtain the generalizable translation knowledge. This GP initialization gives the IS model an efficient starting point, thus enabling its fast adaptation to the new scene with scarce training data. We conduct extensive I2I translation experiments on human face and street view datasets. Quantitative results validate that our approach can significantly boost the performance of classical I2I translation models, such as PG2 and Pix2Pix. Our visualization results show both higher image quality and more appropriate instance-specific details, e.g., the translated image of a person looks more like that person in terms of identity.

연구 동기 및 목표

  • 제한된 쌍화된 훈련 데이터를 가진 이미지 간 번역에서 높은 다양성과 카테고리 편향 문제를 해결하기 위해.
  • 소수의 훈련 이미지로만 새로운 환경에 번역 모델을 신속하게 적응시킬 수 있도록 하기 위해.
  • 다양한 환경에서 일반화 가능한 번역 지식을 학습하면서도 개별 사례의 특성(예: 정체성, 세부 사항)을 유지하기 위해.
  • 특히 스트리트 뷰와 같은 복잡한 환경에서 저자료 환경에서의 이미지 품질 향상과 잡음 감소를 위해.

제안 방법

  • BiL 프레임워크는 새로운 환경용 개별 사례(IS) 모델을 훈련하는 것과 동시에 IS 모델의 검증 손실을 사용해 일반 목적(GP) 모델을 업데이트하는 방식으로 번갈아가며 작동한다.
  • GP 모델은 다양한 환경에서 훈련되어 일반화 가능한 번역 지식을 학습하고, 이를 바탕으로 IS 모델의 초기화를 통해 신속한 적응을 가능하게 한다.
  • 구조적 정보를 기반으로 한 환경 유사도 지표를 통해 유사한 환경를 식별하고, GP 모델의 보조 미세조정을 이끌어내는 데 활용한다.
  • 보조 미세조정은 유사한 환경의 데이터를 통합함으로써 GP 모델의 성능을 향상시키고, 새로운 IS 작업에 대한 초기화 품질을 높인다.
  • IS 모델은 대상 환경의 소수의 이미지로만 GP 가중치에서 미세조정되며, 정체성과 세부 사항을 유지한다.
  • 이 프레임워크는 모델 아키텍처와 독립적이며, 아키텍처 변경 없이도 기존 모델인 PG 2 및 Pix2pix의 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1소수의 이미지로 이미지 간 번역을 수행할 때 일반 목적 모델이 개별 사례 모델의 초기화에 효과적으로 활용될 수 있는가?
  • RQ2유사한 환경를 효율적으로 식별하고 이를 통해 소수의 이미지로 번역 적응을 향상시킬 수 있는가?
  • RQ3유사한 환경 데이터를 사용해 일반 목적 모델을 보조적으로 미세조정하면 일반화 능력 향상과 개별 사례 모델 성능 향상에 기여하는가?
  • RQ4BiL 프레임워크는 저자료 환경에서 잡음 감소와 정체성 유지 능력을 얼마나 향상시키는가?
  • RQ5표준 기준 모델 대비 스트리트 뷰와 같은 다양한 복잡한 데이터셋에서 BiL 접근법은 어떤 성능을 보이는가?

주요 결과

  • FaceForensics 데이터셋에서 BiL-PG 2 (5-shot)는 LPIPS를 PG 2 (5-shot) 대비 49.8% 감소시켜 0.106에서 0.053으로 개선했고, PSNR는 4.61 dB 향상되었다.
  • 1-shot 얼굴 번역에서 BiL-PG 2는 LPIPS를 0.100에서 0.076으로 감소시키고 SSIM을 0.584에서 0.655로 향상시켜 강력한 일반화 능력을 보였다.
  • 도전적인 교차 데이터셋 스트리트 뷰 설정에서 BiL-PG 2 (1-shot)는 LPIPS를 8.0% 감소시켜 0.174에서 0.160으로 개선했고, SSIM은 11.3% 향상시켜 0.400에서 0.445로 향상되었다.
  • GP 모델의 출력은 일반적인 지식을 평균적인 얼굴과 흐린 배경으로 표현하며, 학습된 일반화 능력을 확인한다.
  • 보조 미세조정은 성능 향상에 크게 기여했으며, BiL-PG 2 (1-shot)는 LPIPS 0.160, SSIM 0.445를 기록해 기준 모델 PG 2 (1-shot)의 LPIPS 0.174, SSIM 0.400을 능가했다.
  • 정성적 결과에서는 특히 복잡한 환경에서 정체성 유지(예: 머리카락, 피부)와 더 선명한 세부 사항(예: 눈, 유리 창문)이 뛰어나게 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.