[논문 리뷰] High-Resolution Image Inpainting with Iterative Confidence Feedback and Guided Upsampling
이 논문은 큰 구멍에서 예측을 점진적으로 개선하기 위해 신뢰도 피드백 메커니즘을 사용하는 반복적 고해상도 이미지 복원 방법을 제안한다. 이로 인해 시각적 품질이 향상되고 잡음이 감소한다. 깊이 있는 생성 모델을 통해 복원된 이미지와 신뢰도 맵을 동시에 예측하도록 훈련시킴으로써, 반복 과정에서 높은 신뢰도 영역을 우선적으로 신뢰하고, 고해상도 세부 정보를 향상시키기 위해 유도적 업샘플링을 적용함으로써, 실제 물체 제거 작업에서 최신 기술 수준의 성능을 달성한다.
Existing image inpainting methods often produce artifacts when dealing with large holes in real applications. To address this challenge, we propose an iterative inpainting method with a feedback mechanism. Specifically, we introduce a deep generative model which not only outputs an inpainting result but also a corresponding confidence map. Using this map as feedback, it progressively fills the hole by trusting only high-confidence pixels inside the hole at each iteration and focuses on the remaining pixels in the next iteration. As it reuses partial predictions from the previous iterations as known pixels, this process gradually improves the result. In addition, we propose a guided upsampling network to enable generation of high-resolution inpainting results. We achieve this by extending the Contextual Attention module to borrow high-resolution feature patches in the input image. Furthermore, to mimic real object removal scenarios, we collect a large object mask dataset and synthesize more realistic training data that better simulates user inputs. Experiments show that our method significantly outperforms existing methods in both quantitative and qualitative evaluations. More results and Web APP are available at https://zengxianyu.github.io/iic.
연구 동기 및 목표
- 큰 구멍에 대해 현실적인 고해상도 이미지 복원 결과를 생성하는 데 도전하는 것, 특히 실제 세계의 물체 제거 시나리오에서의 과제를 해결하기 위함.
- 큰 구멍의 불확실성과 구조적 이해 부족으로 인해 기존 딥 러닝 기반 복원 방법에서 발생하는 시각적 잡음을 줄이는 것.
- 예측 신뢰도를 기반으로 반복적으로 예측을 개선하는 신뢰도 피드백 루프를 도입함으로써 모델의 강건성을 향상시키는 것.
- 유도적 업샘플링을 사용하여 구조적 생성과 텍스처 세부 정보 복원을 분리함으로써 고해상도 출력 품질을 향상시키는 것.
- 실제 사용자 입력을 시뮬레이션하는 다양한 구멍 패턴을 생성하기 위해 물체 모양의 마스크를 수집하고, 이를 기반으로 더 현실적인 훈련 데이터를 생성하는 것.
제안 방법
- 이 방법은 복원된 이미지와 신뢰도 맵을 동시에 출력하는 딥 생성 모델을 사용하며, 높은 신뢰도를 가진 픽셀은 후속 반복에서 더 신뢰한다.
- 반복 피드백 루프는 신뢰도 맵을 사용하여 신뢰할 수 있는 예측를 식별하고, 이를 알려진 영역로 간주하며 나머지 불확실한 부분만 재처리한다.
- 유도적 업샘플링 네트워크는 저해상도 출력과 유사한 고해상도 특징 패치를 입력 이미지에서 빌려와 고해상도 결과를 복원한다.
- 컨텍스트 추적 모듈을 확장하여 고해상도에서 특징 패치 검색 기능을 가능하게 하여 최종 출력의 텍스처 세부 정보 정확도를 향상시킨다.
- 훈련 데이터는 대규모 물체 마스크 데이터셋을 활용하여 증강되며, 배경 전용 및 전경 가림 구멍 시나리오를 모두 포함하여 실제 사용자 입력을 시뮬레이션한다.
- 모델는 복원 손실과 적대적 손실의 조합으로 훈련되며, 별도의 신뢰도 디코더 헤드를 통해 신뢰도 예측을 유도한다.
실험 결과
연구 질문
- RQ1예측의 신뢰도를 기반으로 한 반복 피드백 메커니즘이 큰 구멍에 대한 이미지 복원 품질을 향상시킬 수 있는가?
- RQ2예측의 신뢰도 기반 점진적 개선 방식이 사전 정의된 점진적 복원 전략과 비교할 때 시각적 및 정량적 성능에서 어떻게 다를까?
- RQ3고해상도 특징을 사용한 유도적 업샘플링이 고해상도 복원 결과의 현실성과 세부 정보를 향상시킬 수 있는가?
- RQ4실제로 물체 모양의 훈련 데이터를 사용할 경우, 일반화 능력과 실제 응용에서의 사용자 선호도는 어느 정도 향상되는가?
- RQ5신뢰도 임계값과 반복 횟수와 같은 하이퍼파rameter의 변화에 대해 성능는 얼마나 민감한가?
주요 결과
- 반복적 신뢰도 피드백(CF)을 적용한 제안된 방법은 CelebA-HQ 데이터셋에서 PSNR 28.20과 FID 0.8985를 기록하여, 신뢰도 피드백이 없는 기준 모델보다 우수한 성능을 보였다.
- 반복적 신뢰도 피드백 메커니즘은 높은 신뢰도 영역(PSNR 36.38, FID 0.981)에서 낮은 신뢰도 영역(PSNR 30.00, FID 0.923)보다 성능 향상이著명했다.
- 실제적인 훈련 데이터(RT)를 포함함으로써 성능 향상이 이루어졌으며, Ours* 모델은 PSNR 27.67과 FID 0.8949를 기록하여 실제 사용자 입력에 대한 일반화 능력이 향상됨을 보였다.
- 유도적 업샘플링은 고해상도 생성을 가능하게 하였다: Ours 모델은 복원 제약 조건으로 인해 정량적 점수는 약간 낮지만, 1024×1024 결과에서 훨씬 뛰어난 시각적 품질과 향상된 텍스처 세부 정보를 제공하였다.
- 모델는 하이퍼파rameter 변화에 대해 강건하다: 민감도 분석 결과 λ 값이 0.7에서 0.13 사이의 범위에서 PSNR가 안정적으로 28.1–28.5 범위를 유지하였다.
- 사용자 연구 결과, 유도적 업샘플링 버전(Ours)이 Ours*보다 더 자주 선호되었으며, 이는 정량적 점수는 약간 낮지만 시각적 품질이 향상되었음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.