Skip to main content
QUICK REVIEW

[논문 리뷰] Harmonizer: Learning to Perform White-Box Image and Video Harmonization

Zhanghan Ke, Chunyi Sun|arXiv (Cornell University)|2022. 07. 04.
Generative Adversarial Networks and Image Synthesis인용 수 4
한 줄 요약

Harmonizer는 흑상자 자동에코더 대신 이미지 수준의 필터 인자(예: 밝기, 대비)를 회귀하는 백색 상자형, 경량 프레임워크를 제안한다. 이는 1080P 해상도에서 56fps 성능을 기록하며 기존 방법보다 훨씬 빠른 추론 속도를 확보하면서도 높은 정밀도와 프레임 간 일관성을 유지하여 최신 기술 수준을 달성한다.

ABSTRACT

Recent works on image harmonization solve the problem as a pixel-wise image translation task via large autoencoders. They have unsatisfactory performances and slow inference speeds when dealing with high-resolution images. In this work, we observe that adjusting the input arguments of basic image filters, e.g., brightness and contrast, is sufficient for humans to produce realistic images from the composite ones. Hence, we frame image harmonization as an image-level regression problem to learn the arguments of the filters that humans use for the task. We present a Harmonizer framework for image harmonization. Unlike prior methods that are based on black-box autoencoders, Harmonizer contains a neural network for filter argument prediction and several white-box filters (based on the predicted arguments) for image harmonization. We also introduce a cascade regressor and a dynamic loss strategy for Harmonizer to learn filter arguments more stably and precisely. Since our network only outputs image-level arguments and the filters we used are efficient, Harmonizer is much lighter and faster than existing methods. Comprehensive experiments demonstrate that Harmonizer surpasses existing methods notably, especially with high-resolution inputs. Finally, we apply Harmonizer to video harmonization, which achieves consistent results across frames and 56 fps at 1080P resolution. Code and models are available at: https://github.com/ZHKKKe/Harmonizer.

연구 동기 및 목표

  • 자기에코더 기반 이미지 조화 방법의 한계를 해결하기 위해, 고해상도 성능이 열악하고 추론 속도가 느리며 투명성이 없는 흑상자 성질을 개선하고자 한다.
  • 인간이 사용하는 필터 조정 방식과 유사한 이미지 조화가, 픽셀 수준의 변환 대신 학습 가능한 해석 가능한 필터 조정을 통해 달성 가능한지 탐구하고자 한다.
  • 영상 조화에서 시각적 일관성을 유지하면서도 경량적이고 효율적이며 안정적인 프레임워크를 설계하고자 한다.
  • 학습 중 필터 간 상호의존성과 손실 불균형 문제를 해결하여 필터 인자 예측 성능을 향상시키고자 한다.

제안 방법

  • Harmonizer는 이미지 조화를 이미지 수준의 회귀 문제로 모델링하여, 백색 상자형 필터에 대한 필터 인자(예: 밝기, 대비, 색온도)를 예측한다.
  • 상호의존성이 있는 필터 간 간섭을 줄이기 위해 순차적으로 필터 인자를 예측하는 캐스케이드 리그레서를 사용한다.
  • 어려운 필터보다 쉽게 학습되는 필터에 편향되지 않도록, 필터 간 기울기 균형을 맞추는 동적 손실 전략을 도입하여 학습 안정성을 향상시킨다.
  • 신경망 기반 백본과 리그레서 헤드를 사용해 필터 파라미터를 예측한 후, 효율적이고 미분 가능한 백색 상자형 필터를 통해 이미지 변환을 수행한다.
  • 영상 조화를 위해 지수 이동 평균(EMA) 전략을 사용하여 프레임 간 시간적 일관성을 확보한다.
  • 픽셀 수준의 출력에 대한 엔드 투 엔드 학습을 피하여 모델 복잡도와 계산 비용을 감소시킨다.

실험 결과

연구 질문

  • RQ1인간이 사용하는 필터 파rameter의 회귀로 효과적으로 이미지 조화를 모델링할 수 있는가, 픽셀 수준의 변환 작업 대신 말이다?
  • RQ2상호의존성이 있는 필터 파라미터(예: 밝기와 대비)를 캐스케이드 방식으로 더 정확하게 예측할 수 있는가?
  • RQ3동적 손실 전략이 학습 안정성을 향상시키고 특정 필터 유형에 대한 편향을 방지하는 데 기여하는가?
  • RQ4제안된 방법은 고해상도 및 실시간 영상 조화 환경에서 어떻게 성능을 발휘하는가?
  • RQ5백색 상자형, 필터 기반 접근 방식이 흑상자 자동에코더보다 더 높은 시각적 품질과 일관성을 달성할 수 있는가?

주요 결과

  • Harmonizer는 256×256 해상도에서 iHarmony4 데이터셋에서 MSE 24.26을 기록하며, 기존 방법들보다 뚜렷한 격차를 확보해 새로운 최고 성능을 달성했다.
  • 1080P 해상도에서 RTX3090 GPU에서 56fps의 추론 속도를 기록했으며, 기존 자기에코더 기반 방법들이 약 10fps에 머무르는 것과 비교해 뚜렷한 성능 우월성을 보였다.
  • 제거 실험을 통해 캐스케이드 리그레서와 동적 손실 전략이 모두 필수적임을 확인했으며, 기준 모델 대비 PSNR는 0.89dB 향상되고 MSE는 2.59 감소했다.
  • 사용자 연구 결과, Harmonizer는 영상 조화에서 가장 높은 B-T 점수(2.042)를 기록했으며, 기존 방법들을 크게 앞서며 조합 입력조차도 초월했다.
  • 8개의 필터를 사용할 경우, 1080P에서 PSNR 38.06, 51.9fps 성능을 기록해 성능과 속도 사이의 우수한 트레이드오���을 보였다.
  • 시각적 결과는 자동에코더 기반 방법들과 비교해 Harmonizer가 이미지 세부 정보를 더 잘 유지하고 텍스처 왜곡을 방지함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.