[논문 리뷰] DoveNet: Deep Image Harmonization via Domain Verification
이 논문은 복합 이미지에서 전경 도메인을 배경 도메인과 정렬하기 위해 새로운 도메인 검증 판별자를 사용하는 딥러닝 방법인 DoveNet을 제안한다. 이 방법은 COCO, Adobe5k, Flickr 및 day2night 데이터셋에서 추출한 실제 복합 이미지를 엄격한 필터링을 통해 합성한 새로운 대규모 데이터셋 iHarmony4에서 최신 기술 성능을 달성한다.
Image composition is an important operation in image processing, but the inconsistency between foreground and background significantly degrades the quality of composite image. Image harmonization, aiming to make the foreground compatible with the background, is a promising yet challenging task. However, the lack of high-quality publicly available dataset for image harmonization greatly hinders the development of image harmonization techniques. In this work, we contribute an image harmonization dataset iHarmony4 by generating synthesized composite images based on COCO (resp., Adobe5k, Flickr, day2night) dataset, leading to our HCOCO (resp., HAdobe5k, HFlickr, Hday2night) sub-dataset. Moreover, we propose a new deep image harmonization method DoveNet using a novel domain verification discriminator, with the insight that the foreground needs to be translated to the same domain as background. Extensive experiments on our constructed dataset demonstrate the effectiveness of our proposed method. Our dataset and code are available at https://github.com/bcmi/Image_Harmonization_Datasets.
연구 동기 및 목표
- 기존 이미지 히어모니제이션 데이터셋의 낮은 현실성과 제한된 다양성으로 인해 강력한 딥러닝 모델 훈련이 어려운 문제를 해결하기 위해.
- 통제된 전경-배경 불일치를 갖는 실제 이미지에서 복합 이미지를 합성함으로써 데이터 효율적이면서도 고품질의 훈련 파이프라인을 개발하기 위해.
- 전경의 도메인을 배경의 도메인과 명시적으로 정렬하는 적대적 도메인 검증 기반의 새로운 딥 이미지 히어모니제이션 방법 DoveNet을 제안하기 위해.
- HCOCO, HAdobe5k, HFlickr 및 Hday2night라는 네 개의 서브데이터셋을 포함하는 대규모, 다양한, 고품질의 이미지 히어모니제이션 데이터셋인 iHarmony4를 구축하고 공개하기 위해.
- 데이터셋 정제 과정에서 대표성 없거나 비현실적이거나 의미적으로 잘못된 복합 이미지를 제거하여 히어모니제이션된 이미지의 일반화 능력과 현실성 향상시키기 위해.
제안 방법
- COCO, Adobe5k, Flickr 및 day2night 데이터셋의 실제 이미지에서 전경 세그멘테이션과 자동 색상 이동을 사용하여 복합 이미지를 합성함으로써 새로운 이미지 히어모니제이션 데이터셋 iHarmony4를 구축한다.
- 낮은 품질의 복합 이미지, 예를 들어 가림을 입은 객체, 비현실적인 색상 이동, 또는 부가적인 변화(예: 불 켜짐) 등을 제거하기 위해 수동 필터링을 적용하여 데이터셋 품질을 확보한다.
- 실제 이미지의 쌍체 전경 및 배경 특징을 양성 쌍으로, 복합 이미지의 특징을 음성 쌍으로 간주하는 도메인 검증 판별자를 갖춘 GAN 기반의 히어모니제이션 모델인 DoveNet을 제안한다.
- 도메인 검증 판별자를 훈련시어 전경과 배경이 같은 도메인(실제 이미지)인지 또는 다른 도메인(복합 이미지)인지 식별하도록 하여 도메인 정렬을 유도한다.
- 내용을 유지하면서 색상과 조명을 조화롭게 하기 위해 지각적, 적대적, 복원 손실을 조합한 다중 손실 훈련 목표를 사용한다.
- 이미지 히어모니제이션이 명시적인 도메인 레이블 없이도 도메인 적응으로 간주될 수 있다는 통찰을 활용한다: 전경을 배경의 도메인에 맞추어 변환한다.
실험 결과
연구 질문
- RQ1기존 데이터셋의 다양성과 현실성에 한계가 있는 점을 극복하기 위해, 합성된 대규모 고품질의 이미지 히어모니제이션 데이터셋을 구축할 수 있는가?
- RQ2명시적인 도메인 레이블이 없이도 도메인 검증 판별자가 복합 이미지에서 전경 도메인과 배경 도메인을 효과적으로 정렬할 수 있는가?
- RQ3제안된 DoveNet 모델이 합성 및 실제 복합 이미지 모두에서 기존 최신 기술 대비 정량적 지표와 정성적 시각적 결과에서 뛰어난 성능을 보이는가?
- RQ4특히 '사람'처럼 내부 다양성이 높은 의미적 카테고리에 대해 모델의 일반화 능력은 어떠한가?
- RQ5합성된 복합 이미지에 대한 수동 필터링이 훈련 데이터의 품질과 신뢰성, 그리고 최종 모델 성능 향상에 얼마나 기여하는가?
주요 결과
- HCOCO, HAdobe5k, HFlickr 및 Hday2night 서브데이터셋을 포함하는 제안된 iHarmony4 데이터셋은 대규모, 다양한, 고품질의 이미지 히어모니제이션 벤치마크를 제공한다.
- HCOCO 서브데이터셋에서 DoveNet은 fMSE(전경 평균 제곱 오차)에서 뚜렷한 향상을 보이며, '마우스' 카테고리에서 최대 1,141.57의 감소와 '키보드' 카테고리에서 1,058.59의 감소를 기록한다.
- 내부 다양성이 높은 '사람' 카테고리에서도 DoveNet은 fMSE를 437.32 감소시켜 도전적인 변형에도 불구하고 뛰어난 강건성을 보여준다.
- 99개의 실제 복합 이미지에 대한 사용자 연구 및 정성적 결과 분석에서 DoveNet은 DIH, S2AM 및 Xue et al.와 같은 기존 방법보다 더 자연스럽고 조화로운 결과를 생성한다.
- 도메인 검증 판별자가 실제로 정확하게 실 이미지(양성)와 복합 이미지(음성) 쌍을 구분할 수 있음을 바탕으로, 전경과 배경 도메인 간의 정렬을 효과적으로 학습하고 있음을 입증한다.
- 수동 필터링은 불합리한 변화(예: 불 켜짐, 눈 오름) 또는 의미 없는 객체(예: 부분적으로 가려진 사람)를 포함한 복합 이미지를 제거함으로써 데이터셋 품질을 크게 향상시키고, 이는 더 신뢰할 수 있는 훈련과 성능 향상으로 이어진다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.