Skip to main content
QUICK REVIEW

[논문 리뷰] High-Resolution Photorealistic Image Translation in Real-Time: A Laplacian Pyramid Translation Network

Jie Liang, Hui Zeng|arXiv (Cornell University)|2021. 05. 19.
Advanced Image Processing Techniques참고 문헌 32인용 수 7
한 줄 요약

이 논문은 라플라시안 피라미드 분해를 통해 저주파 성질(예: 조명, 색상)과 고주파 성질(세부 정보)을 분리함으로써 실시간, 고해상도의 사진처럼 생긴 이미지 간 번역을 가능하게 하는 라플라시안 피라미드 번역 네트워크(LPTN)를 제안한다. 저해상도의 저주파 성분에 가벼운 네트워크를 적용하고, 고주파 성분을 정밀하게 다듬기 위해 점진적 마스킹 전략을 사용함으로써 LPTN은 단일 GPU에서 실시간 4K 추론을 구현하면서도 최신 기술 수준의 사진적 사실성과 스타일 전이 성능을 유지하거나 초월한다.

ABSTRACT

Existing image-to-image translation (I2IT) methods are either constrained to low-resolution images or long inference time due to their heavy computational burden on the convolution of high-resolution feature maps. In this paper, we focus on speeding-up the high-resolution photorealistic I2IT tasks based on closed-form Laplacian pyramid decomposition and reconstruction. Specifically, we reveal that the attribute transformations, such as illumination and color manipulation, relate more to the low-frequency component, while the content details can be adaptively refined on high-frequency components. We consequently propose a Laplacian Pyramid Translation Network (LPTN) to simultaneously perform these two tasks, where we design a lightweight network for translating the low-frequency component with reduced resolution and a progressive masking strategy to efficiently refine the high-frequency ones. Our model avoids most of the heavy computation consumed by processing high-resolution feature maps and faithfully preserves the image details. Extensive experimental results on various tasks demonstrate that the proposed method can translate 4K images in real-time using one normal GPU while achieving comparable transformation performance against existing methods. Datasets and codes are available: https://github.com/csjliang/LPTN.

연구 동기 및 목표

  • 고해상도 특징 맵에서의 강력한 컨볼루션 연산으로 인해 기존 사진적 사실성 있는 이미지 간 번역(I2IT) 방법의 효율성이 떨어지는 문제를 해결하기 위해.
  • 깊은 인코딩-디코딩 구조를 사용하고 고해상도 특징 처리에 의존하는 기존의 오토에인코드르 기반 및 GAN 기반 I2IT 모델에서 발생하는 계산 병목 현상을 극복하기 위해.
  • 세부 내용을 유지하면서도 실시간으로 4K 이미지를 처리할 수 있도록 하되, 정교한 콘텐츠 세부 정보와 사진적 스타일 전이를 구현하기 위해.
  • 라플라시안 피라미드의 주파수 대역 특성 구조를 활용해 도메인 특화 속성(예: 조명, 색상)을 콘텐츠 세부 정보에서 분리하기 위해.
  • 재구성 정밀도를 유지하면서도 비지도, 적대적 학습을 지원하는 경량의 종단 간 훈련 가능한 프레임워크를 개발하기 위해.

제안 방법

  • 고해상도 입력 이미지를 다중 해상도 주파수 대역으로 분리하기 위해 폐쇄형 라플라시안 피라미드 분해를 적용한다: 하나의 저주파 성분과 다수의 감쇠되는 해상도의 고주파 성분.
  • 저해상도에서 저주파 성분을 번역하기 위해 경량 잔차 네트워크를 사용하여 계산 비용을 최소화하면서도 조명, 색상 등의 전반적 속성을 유지한다.
  • 가장 작은 고주파 성분에서 마스크를 학습하고, 이중 선형 보간과 두 개의 컨볼루션 계층을 통해 상향 변환하여 더 높은 주파수 성분을 정밀하게 다듬는 점진적 마스킹 전략을 설계한다.
  • 사진적 사실성과 콘텐츠 일관성을 보장하기 위해 적대적 손실을 사용하여 전체 네트워크를 비지도 방식으로 종단 간 훈련한다.
  • 역 라플라시안 피라미드 재구성 방법을 사용하여 번역된 저주파 성분과 정밀화된 고주파 성분을 조합하여 최종 출력을 재구성한다.
  • 고주파 성분 간의 공간적 상관관계를 활용하여 계산을 줄인다—오직 가장 작은 고주파 마스크만 소규모 네트워크로 예측함으로써 고해상도 컨볼루션을 피한다.

실험 결과

연구 질문

  • RQ1라플라시안 피라미드 분해를 통해 속성 조작과 세부 정보 다듬기 사이를 분리함으로써 효율적이고 고해상도의 사진적 사실성 있는 이미지 번역이 가능할 수 있는가?
  • RQ2저주파 성분을 번역하고 점진적 마스킹 전략을 사용해 고주파 성분을 적응적으로 다듬는 것이 이미지 품질을 손상시키지 않으면서도 계산 비용을 줄일 수 있는가?
  • RQ3제안된 방법이 4K 이미지에서 실시간 추론를 수행하면서 최신 기술 수준의 I2IT 모델과 경쟁 가능한 성능을 유지를 할 수 있는가?
  • RQ4도메인 특화 속성(예: 시간대, 계절)을 콘텐츠 세부 정보에서 분리함으로써 번역 정밀도와 사진적 사실성에 어떤 영향을 미치는가?
  • RQ5표준 GAN 기반 또는 오토에인코드르 기반 I2IT 방법에 비해 점진적 마스킹 전략이 세밀한 질감을 얼마나 잘 유지하고 잡음과 기하학적 왜곡을 줄이는가?

주요 결과

  • LPTN은 단일 데스크톱 GPU를 사용하여 4K 이미지에서 실시간 추론를 구현하며, L=4일 때 1080p 이미지에 대한 CycleGAN 대비 약 ×80의 속도 향상을 달성한다.
  • L=5 단계의 라플라시안 피라미드 분해를 사용할 경우, 4K 해상도 이미지에서 실시간으로 실행된다.
  • 사용자 연구 결과, LPTN은 주간→야간 번역에서 사진적 사실성에 대해 78.3%의 선호도를 기록했으며, 미적 품질에 대해서는 57.5%를 기록했다. 이는 CycleGAN(16.4% 및 21.3%) 및 기타 기준 모델보다 유의미하게 뛰어나다.
  • 정량적 결과에 따르면, 주간과 야간 이미지의 고주파 성분 간 MSE는 저주파 성분의 약 1/71과 1/65 수준이었으며, 이는 속성 변화가 주로 저주파 콘텐츠에 의해 지배됨을 시사한다.
  • LPTN은 CycleGAN 및 UNIT와 같은 방법에서 흔히 발생하는 구조 왜곡과 잡음과 같은 문제를 피하면서도 높은 재구성 정밀도를 유지한다. 특히 넓은 균일 영역을 포함한 장면에서 두드러진다.
  • 점진적 마스킹 전략은 오직 두 개의 컨볼루션 계층과 선형 보간만을 사용하여 고주파 성분을 효율적으로 다듬으며, 고해상도 맵에서의 무거운 컨볼루션을 피한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.