Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Image Harmonization by Bridging the Reality Gap

Junyan Cao, Wenyan Cong|arXiv (Cornell University)|2021. 03. 31.
Image and Signal Denoising Methods참고 문헌 4인용 수 9
한 줄 요약

이 논문은 3D 렌더링을 통해 생성된 렌더링 이미지 데이터셋인 RdHarmony를 제안하며, 수동 데이터 수집 노력을 줄이기 위해 대규모의 렌더링 이미지 투입을 위한 데이터셋을 제공하고, 적대적 손실, 스타일 인식 손실, 도메인 불변 특징 학습을 활용해 렌더링된 이미지와 실제 이미지 간의 현실성 격차를 해소하는 CharmNet을 도입한다. 이 방법은 제한된 실제 데이터로도 새로운 카테고리에서 강력한 성능을 달성하여, 렌더링된 도메인에서 실제 도메인으로의 지식 전이가 효과적임을 입증한다.

ABSTRACT

Image harmonization has been significantly advanced with large-scale harmonization dataset. However, the current way to build dataset is still labor-intensive, which adversely affects the extendability of dataset. To address this problem, we propose to construct rendered harmonization dataset with fewer human efforts to augment the existing real-world dataset. To leverage both real-world images and rendered images, we propose a cross-domain harmonization network to bridge the domain gap between two domains. Moreover, we also employ well-designed style classifiers and losses to facilitate cross-domain knowledge transfer. Extensive experiments demonstrate the potential of using rendered images for image harmonization and the effectiveness of our proposed network.

연구 동기 및 목표

  • 3D 렌더링을 통해 합성 학습 데이터를 생성하여 실제 세계의 이미지 히어로니제이션 데이터셋을 수집하는 데 드는 수고를 줄이기 위해.
  • 모델의 일반화 능력을 떨어뜨리는 렌더링된 이미지(소스 도메인)와 실제 이미지(타겟 도메인) 간의 도메인 격차를 해결하기 위해.
  • 특히 기존의 실제 데이터셋에 존재하지 않는 새로운 배경 카테고리에 대해 효과적인 교차 도메인 지식 전이를 가능하게 하기 위해.
  • 렌더링된 이미지와 실제 이미지를 모두 활용하는 통합 프레임워크를 개발하여, 분포 외부 테스트 케이스에서 성능을 향상시키기 위해.

제안 방법

  • Unity3D와 UniStorm을 사용하여 다양한 조명 조건과 촬영 조건에서 이미지를 생성함으로써 대규모의 렌더링 히어로니제이션 데이터셋인 RdHarmony를 구축한다.
  • 3D 시나리오 렌더링을 활용해 정확한 전경 마스크를 갖춘 복합 이미지를 생성함으로써 전경 교체가 용이해져 풍부한 훈련 쌍을 생성할 수 있도록 한다.
  • CharmNet을 제안하며, 세 단계로 구성된 네트워크로 구성된다: 적대적 도메인 정렬을 위한 도메인 전용 인코딩, 특징 공유를 위한 도메인 불변 인코딩-디코딩, 재구성용 도메인 전용 디코딩.
  • UniStorm에서 제공하는 명시적 스타일 레이블을 활용해 스타일 인식 손실을 도입하여 특징 적응을 이끌고 교차 도메인 전이를 향상시킨다.
  • 특징 분포를 렌더링된 이미지 도메인과 실제 이미지 도메인 간에 정렬하기 위해 적대적 손실을 활용하여 도메인 이동을 줄인다.
  • 스타일 집합(Style Aggregation, SA) 손실을 통합하여 도메인 간의 스타일 특징를 명시적으로 모델링하고 전이함으로써 특징 히어로니제이션을 향상시킨다.

실험 결과

연구 질문

  • RQ13D 렌더링을 통해 생성된 렌더링 이미지가 최소한의 인간 주석으로 실제 세계의 이미지 히어로니제이션 데이터셋을 효과적으로 보완할 수 있는가?
  • RQ2딥 러닝 모델이 이미지 히어로니제이션에서 렌더링된 이미지와 실제 이미지 간의 도메인 격차를 효과적으로 해소할 수 있는가?
  • RQ3렌더링된 이미지 도메인에서의 지식이 새로운 전경 카테고리에 대해 실제 세계의 테스트 이미지에서 성능을 얼마나 향상시킬 수 있는가?
  • RQ4효과적인 교차 도메인 지식 전이를 위해 이미지 히어로니제이션에서 가장 중요한 구성 요소는 무엇인가?

주요 결과

  • 제안된 CharmNet는 새로운 카테고리의 실제 세계 테스트 이미지에서 최신 기술 수준의 성능을 달성하며, iDIH 및 CUT와 같은 베이스라인을 크게 능가한다.
  • 적대적 손실과 스타일 인식 손실을 결합하면 히어로니제이션 품질에서 상호 보완적인 향상이 이루어지며, 특히 도메인 정렬 측면에서 적대적 손실이 가장 큰 기여를 한다.
  • 새로운 카테고리의 실제 훈련 데이터를 렌더링된 이미지로 보완하면 일관된 성능 향상이 이루어지며, 특히 실제 데이터가 부족할 경우 더욱 두드러진다.
  • 제거 실험을 통해 도메인 전용 인코딩과 도메인 불변 디코딩 단계가 모두 필수적임을 확인하였으며, 비균형적인 비공유 레이어 수보다 균형 잡힌 수의 비공유 레이어를 사용할 경우 최적의 성능을 달성한다.
  • 정성적 결과에서는 CharmNet가 더 시각적으로 일관된 히어로니제이션 출력을 생성하며, 전경의 스타일이 배경과 밀도 있게 일치하면서도 전경 콘텐츠를 왜곡하지 않는 것을 확인할 수 있다.
  • 실제 복합 이미지에 대한 사용자 연구 결과, RdHarmony와 CharmNet로 훈련된 모델이 베이스라인 대비 더 높은 인지적 품질을 선호함을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.