Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Stacked Networks with Residual Polishing for Image Inpainting

Uğur Demir, Gözde Ünal|arXiv (Cornell University)|2017. 12. 31.
Advanced Image Processing Techniques참고 문헌 20인용 수 6
한 줄 요약

이 논문은 이미지 복원을 위한 이중 단계 딥러닝 프레임워크인 Residual Polishing을 제안한다. 여기서 Coarse Painter Network (CPN)은 문맥적 특징을 사용하여 먼저 누락 영역을 채운다. 그 후 Fine Painter Network (FPN)이 잔류 보정을 학습하여 잡음과 아티팩트를 감소시킨다. 이 방법은 Google Street View 데이터셋에서 SOTA 수준의 PSNR 22.89 dB를 달성하며, 이는 이전 방법들에 비해 시각적 품질과 정량적 지표에서 뚜렷한 향상을 보인다.

ABSTRACT

Deep neural networks have shown promising results in image inpainting even if the missing area is relatively large. However, most of the existing inpainting networks introduce undesired artifacts and noise to the repaired regions. To solve this problem, we present a novel framework which consists of two stacked convolutional neural networks that inpaint the image and remove the artifacts, respectively. The first network considers the global structure of the damaged image and coarsely fills the blank area. Then the second network modifies the repaired image to cancel the noise introduced by the first network. The proposed framework splits the problem into two distinct partitions that can be optimized separately, therefore it can be applied to any inpainting algorithm by changing the first network. Second stage in our framework which aims at polishing the inpainted images can be treated as a denoising problem where a wide range of algorithms can be employed. Our results demonstrate that the proposed framework achieves significant improvement on both visual and quantitative evaluations.

연구 동기 및 목표

  • 대규모 누락 영역이 있는 딥러닝 기반 이미지 복원에서 발생하는 아티팩트와 잡음을 해결하기 위한 도전 과제를 다루기 위해.
  • 복원 과정을 굵은 복원 단계와 개선 단계로 분리하여 시각적 정밀도와 정량적 성능을 향상시키기 위해.
  • 기존 복원 모델에 유니버설 잔류 보정 네트워크를 통합하여 향상 기능을 제공함으로써, 어떤 기존 복원 모델에도 적용 가능하게 하기 위해.
  • 초기 복원 결과와 진짜 이미지 간의 잔류 보정을 학습하는 것이 국소적 왜곡과 잡음을 감소시키는 데 있어 종단 간 최적화보다 더 효과적임을 입증하기 위해.

제안 방법

  • 프레임워크는 Context-Encoder를 영감으로 삼은 Coarse Painter Network (CPN)을 사용하며, L1, L2 및 인지적(특징) 손실을 함께 사용하여 초기 복원 결과를 생성한다.
  • Fine Painter Network (FPN)은 CPN 출력과 진짜 이미지 간의 잔류 차이를 예측하도록 학습되어 국소적 아티팩트와 잡음을 수정한다.
  • FPN는 합성곱 블록, 배치 정규화, ReLU 활성화 함수를 포함한 잔류 네트워크로 구현되며, 고정된 CPN 가중치를 유지한 채 Adam으로 최적화된다.
  • 보정 단계를 노이즈 제거 문제로 간주함으로써, 다양한 아키텍처와 손실 함수를 자유롭게 활용할 수 있다.
  • CPN과 FPN은 순차적으로 학습된다: 먼저 CPN을 학습한 후, 고정된 CPN 가중치를 유지한 채 FPN을 학습함으로써 별도의 최적화가 가능하다.
  • 이 프레임워크는 일반화 가능하며, 첫 번째 단계 네트워크만 교체하면 어떤 복원 모델에도 적용 가능하다.

실험 결과

연구 질문

  • RQ1이미지 복원을 굵은 복원과 개선 단계로 분리하면 시각적 성능과 정량적 성능이 향상되는가?
  • RQ2초기 복원 결과와 진짜 이미지 간의 잔류 보정을 학습하는 것이 종단 간 최적화보다 아티팩트 억제에 더 효과적인가?
  • RQ3CPN에서 인지적(특징) 손실을 사용할 경우, 픽셀 단위 손실만 사용할 경우에 비해 텍스처 합성 품질에 어떤 영향을 미치는가?
  • RQ4경량의, 과제에 특화된 보정 네트워크가 초기 복원 네트워크에 의해 유도된 국소적 왜곡과 잡음을 효과적으로 줄일 수 있는가?
  • RQ5FPN 아키텍처(예: 잔류 블록, 배치 정규화)의 구성이 최종 복원 품질에 어떤 영향을 미치는가?

주요 결과

  • 제안된 Residual Polishing 프레임워크는 Google Street View 데이터셋에서 PSNR 22.89 dB를 달성하여, Context-Encoder(20.60 dB)와 Neural Patch Synthesis(20.72 dB)를 모두 초월한다.
  • CPN만으로도 PSNR 21.37 dB를 기록하여, 픽셀 단위 손실 외에 인지적(특징) 손실을 추가함으로써 텍스처 합성 품질이 향상됨을 입증한다.
  • FPN는 L1 손실 평균을 CPN의 1.97에서 1.74로, L2 손실 평균을 0.38에서 0.32로 감소시켜 복원 정확도 향상이 뚜렷하게 나타남을 보여준다.
  • 그림 5의 시각적 비교 결과, FPN 출력은 CPN 및 기준 방법에 비해 더 매끄럽고 현실적인 텍스처를 생성하며, 눈에 띄는 아티팩트가 적다.
  • CPN이 열악한 초기 결과를 생성하는 실패 케이스에도 강인하지만, CPN이 합리적인 굵은 복원을 제공할 때 성능 향상이 최대가 된다.
  • FPN 아키텍처에서 배치 정규화와 ReLU를 사용할 경우, 정규화 없이 ReLU 또는 LReLU만 사용하는 것보다 더 나은 수렴과 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.