[논문 리뷰] TransFill: Reference-guided Image Inpainting by Merging Multiple Color and Spatial Transformations
TransFill는 복수의 호모그래피를 사용하여 원본 이미지를 구멍이 있는 대상 이미지에 정렬하고, 학습된 색상 및 공간 변환을 통해 일관성을 확보한 후, 학습된 마스크를 통해 결과를 융합하는 기준 이미지 유도형 이미지 복원 방법을 제안한다. 깊이 기반 호모그래피 추정, 양방향 색상 변환, 다중 제안 융합을 결합하여 시차, 조명 차이, 큰 변형이 있는 복잡한 구멍에서도 최신 기술 수준의 성능을 달성한다.
Image inpainting is the task of plausibly restoring missing pixels within a hole region that is to be removed from a target image. Most existing technologies exploit patch similarities within the image, or leverage large-scale training data to fill the hole using learned semantic and texture information. However, due to the ill-posed nature of the inpainting task, such methods struggle to complete larger holes containing complicated scenes. In this paper, we propose TransFill, a multi-homography transformed fusion method to fill the hole by referring to another source image that shares scene contents with the target image. We first align the source image to the target image by estimating multiple homographies guided by different depth levels. We then learn to adjust the color and apply a pixel-level warping to each homography-warped source image to make it more consistent with the target. Finally, a pixel-level fusion module is learned to selectively merge the different proposals. Our method achieves state-of-the-art performance on pairs of images across a variety of wide baselines and color differences, and generalizes to user-provided image pairs.
연구 동기 및 목표
- 자기 유사성 또는 단일 이미지 생성이 실패하는 경우, 큰 복잡한 구멍을 메우는 데 도전하는 것.
- 동일한 시점의 기준 이미지가 제공될 경우, 심한 시점 변화와 조명 차이가 있는 상황에서도 견고한 이미지 복원을 가능하게 하는 것.
- 전역 호모그래피의 한계를 극복하기 위해 복수의 깊이 추정 호모그래피를 통해 시차를 모델링하는 것.
- 종합적인 학습된 색상 및 공간 변환을 통해 원본 이미지와 대상 이미지 간의 시각적 일관성을 향상시키는 것.
- 가림이나 왜곡으로 인해 픽셀이 손실된 영역에서 고품질의 이미지 복원을 달성하기 위해 다중 변환 제안을 융합하고, 단일 이미지 복원을 백업으로 적용하는 것.
제안 방법
- 대상 이미지와 원본 이미지 간의 기능 대응점을 추정한 후, 깊이 기반으로 내재점을 군집화하여 복수의 깊이 평면을 추론한다.
- 각 깊이 군집에 대해 대응하는 호모그래피를 계산하여 원본 이미지를 대상 이미지에 정렬하고, 복수의 초기 정렬 제안을 생성한다.
- 각 제안에 대해 깊이 기반 이중 색상 변환을 적용하여 원본 이미지와 대상 이미지 간의 색상 분포를 조화롭게 한다.
- 각 픽셀 수준의 공간 변환(왜곡)을 학습하여 정렬을 보완하고 잔여 기하학적 왜곡을 수정한다.
- 다중 변환 제안을 단일 일관성 있는 출력으로 융합하는 데 사용할 수 있는 픽셀별 가중치를 학습하는 융합 네트워크를 훈련한다.
- 워핑 후에 원본 이미지의 내용이 손실된 영역을 메우기 위해 사전 훈련된 단일 이미지 복원 모델(ProFill)을 통합하고, 이 결과와 다중 제안 융합 결과를 결합하는 데 사용할 융합 가중치를 학습한다.

실험 결과
연구 질문
- RQ1다양한 깊이 평면에 각각 정렬된 복수의 호모그래피가 전역 호모그래피보다 시차가 있는 큰 구멍에서 성능을 향상시키는가?
- RQ2다른 조명과 노출 조건을 가진 원본 이미지를 대상 이미지에 정렬하는 데 있어 학습된 색상 및 공간 변환의 효과는 어떠한가?
- RQ3학습 가능한 융합 마스크를 사용해 다중 변환된 원본 제안을 융합하면 단일 또는 무게 없는 융합보다 더 나은 결과를 얻을 수 있는가?
- RQ4제안된 방법은 큰 시점 차이와 복잡한 시나리오 레이아웃을 가진 사용자 제공 이미지 쌍에 대해 얼마나 일반화되는가?
- RQ5워핑 후 원본 이미지의 내용이 손실된 영역에서 단일 이미지 복원 모델을 통합하면 결과가 얼마나 향상되는가?
주요 결과
- TransFill는 RealEstate10K에서 10프레임 이격 시 PSNR 39.59, SSIM 0.9919, LPIPS 0.0116를 기록하며 이전 최신 기술 수준의 방법들을 능가한다.
- 30프레임 이격 시에도 PSNR 35.62, LPIPS 0.0213를 유지하여 큰 기하학적 이동에 대한 강건성을 입증한다.
- 호모그래피 추정을 위한 기능점의 깊이 기반 군집화는 무작위 및 공간 군집화보다 우수하며, 다섯 개의 호모그래피를 사용할 경우 PSNR 37.576을 기록한다.
- 색상-공간 변환 모듈은 핵심적이다: 색상 또는 공간 변환을 제거할 경우 PSNR가 1.0 이상 감소함을 보여주며, 이는 상호 보완적 역할을 한다는 것을 시사한다.
- 색상-공간 변환과 융합 네트워크를 모두 포함한 전체 파이프라인(CST + SPF)이 최고의 성능(PSNR 37.576)을 기록하며, 이는 이러한 구성 요소가 없는 제거 실험보다 유의미하게 뛰어나다.
- 사용자 연구에서 TransFill는 기준 모델 대비 95.65%의 선호도를 기록했으며, p < 10^-6로 강력한 사용자 선호도를 보였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.