Skip to main content
QUICK REVIEW

[논문 리뷰] Spatial-Separated Curve Rendering Network for Efficient and High-Resolution Image Harmonization

Jingtang Liang, Xiaodong Cun|arXiv (Cornell University)|2021. 09. 13.
Advanced Vision and Imaging참고 문헌 41인용 수 5
한 줄 요약

이 논문은 기존의 픽셀 단위의 변환 방식이 아닌 전역 곡선 파라미터 학습 방식을 통해 효율적이고 고해상도 이미지 히든 하모니제이션을 위한 새로운 공간 분리 곡선 렌더링 네트워크인 S2CRNet을 제안한다. 전경 및 배경의 저해상도 미리보기에서 공간 특수 특징을 추출하고, 조각별 선형 곡선을 생성하는 곡선 렌더링 모듈을 사용함으로써, 파라미터 수가 90퍼센트 이상 감소하고 2048×2048 해상도에서 0.1초 이내로 추론하는 것을 달성하며 최신 기술 수준(SOTA)의 성능을 달성한다.

ABSTRACT

Image harmonization aims to modify the color of the composited region with respect to the specific background. Previous works model this task as a pixel-wise image-to-image translation using UNet family structures. However, the model size and computational cost limit the ability of their models on edge devices and higher-resolution images. To this end, we propose a novel spatial-separated curve rendering network(S$^2$CRNet) for efficient and high-resolution image harmonization for the first time. In S$^2$CRNet, we firstly extract the spatial-separated embeddings from the thumbnails of the masked foreground and background individually. Then, we design a curve rendering module(CRM), which learns and combines the spatial-specific knowledge using linear layers to generate the parameters of the piece-wise curve mapping in the foreground region. Finally, we directly render the original high-resolution images using the learned color curve. Besides, we also make two extensions of the proposed framework via the Cascaded-CRM and Semantic-CRM for cascaded refinement and semantic guidance, respectively. Experiments show that the proposed method reduces more than 90% parameters compared with previous methods but still achieves the state-of-the-art performance on both synthesized iHarmony4 and real-world DIH test sets. Moreover, our method can work smoothly on higher resolution images(eg., $2048 imes2048$) in 0.1 seconds with much lower GPU computational resources than all existing methods. The code will be made available at \url{http://github.com/stefanLeong/S2CRNet}.

연구 동기 및 목표

  • 고해상도 및 엣지 디바이스에서 기존 UNet 기반 이미지 히든 하모니제이션 모델의 비효율성과 높은 계산 비용 문제를 해결하기 위해.
  • 딥 러닝 모델에서 픽셀 단위 예측 방식의 한계를 극복하여 해상도가 증가함에 따라 성능이 급격히 저하되는 문제를 해결하기 위해.
  • 픽셀 단위 조정이 아닌 전역 곡선 파라미터 학습으로 문제 재정의함으로써 실시간 고해상도 이미지 히든 하모니제이션을 가능하게 하기 위해.
  • 학습된 색상 곡선을 수동으로 보정할 수 있는 투명하고 편집 가능한 프레임워크를 도입하여 사용자 제어를 가능하게 하기 위해.
  • 향상된 정교화 및 도메인 인식 하모니제이션을 위해 계층적 및 의미 지도 기반 기반 기능을 프레임워크에 통합하기 위해.

제안 방법

  • 공유된 사전 학습된 기반 모델(예: SqueezeNet 또는 VGG16)을 사용하여 전경 및 배경의 저해상도 미리보기에서 공간 분리 전역 특징을 추출한다.
  • 전경 및 배경 특징에 대해 별도의 선형 투영을 적용하여 영역 특화 임bedding을 학습한다.
  • 두 임bedding을 조합하여 각 RGB 채널의 조각별 선형 색상 곡선 함수의 파라미터를 생성한다.
  • 학습된 곡선 파라미터를 직접 사용하여 원본 고해상도 전경을 렌더링함으로써 픽셀 단위 예측을 생략한다.
  • 다중 단계 정교화를 위해 연속적-CRM(Cascaded-CRM)을 도입하여 순차적으로 다수의 곡선 파라미터를 예측한다.
  • 전경 카테고리 기반으로 의미 지도 임베딩을 통합하여 곡선 학습을 유도하는 의미 기반-CRM(Semantic-CRM)을 도입한다.

실험 결과

연구 질문

  • RQ1이미지 히든 하모니제이션은 픽셀 단위의 이미지 간 번역이 아닌 전역 곡선 파라미터 학습 문제로 효과적으로 모델링될 수 있는가?
  • RQ2곡선 기반의 렌더링 접근 방식은 모델 크기와 추론 비용을 크게 줄이며 동시에 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ3기존 방법들과 비교해 볼 때, 제안된 방법은 고해상도 이미지(예: 2048×2048)에서 속도와 계산 효율성 측면에서 어떻게 성능을 내는가?
  • RQ4계층적 및 의미 지도 기반 기반 기능의 통합이 하모니제이션 품질 향상과 새로운 배경 또는 객체에 대한 일반화 능력 향상에 기여하는가?
  • RQ5조각별 선형 근사에서 곡선 수준 수(L)의 변화에 따라 성능에 얼마나 민감한가?

주요 결과

  • S2CRNet는 iHarmony4 및 DIH 데이터셋에서 이전 최신 기술 수준 방법 대비 모델 파라미터를 90퍼센트 이상 감소시키면서도 성능을 유지하거나 향상시켰다.
  • 2048×2048 해상도에서 추론 시간이 0.1초 이내로, 총 0.61 G MACS를 소비하여 기존 방법들보다 빠르고 계산 효율성이 뛰어나게 성능을 뛰어넘었다.
  • 제거 분석 결과, L=64 곡선 수준이 최적의 성능-비용 균형을 이룹니다. L을 64 이상으로 늘일 경우 성능 향상이 미미하며, iHarmony 데이터셋에서는 성능 저하가 발생할 수 있음을 확인하였다.
  • 정량적 비교 결과, 조각별 선형 곡선(Ours)이 Zero-DCE 및 3DLUT와 같은 대안보다 모든 지표(MSE↓, PSNR↑, SSIM↑)에서 우수한 성능을 보였다. HCOCO 및 iHarmony 데이터셋에서의 평가 결과에서 이를 확인하였다.
  • 연속적-CRM는 다중 단계 곡선 예측을 통해 점진적인 정교화를 가능하게 하여 눈에 띄게 향상된 하모니제이션 결과를 도출하였다.
  • 새로운 배경에 대해 이전에 본 적이 없는 전경을 사용한 실험에서, 제안된 방법이 뛰어난 일반화 능력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.