Skip to main content
QUICK REVIEW

[논문 리뷰] Feature Refinement to Improve High Resolution Image Inpainting

Prakhar Kulshreshtha, Brian Pugh|arXiv (Cornell University)|2022. 06. 27.
Generative Adversarial Networks and Image Synthesis인용 수 7
한 줄 요약

이 논문은 추론 중에 다중 해상도 일致성 손실을 사용하여 중간 특징 맵을 반복적으로 최적화함으로써 훈련이 필요 없는 다중 해상도 특징 개선 방법을 제안한다. L1 손실을 사용해 내림샘플링된 출력에 대해 저해상도에서 고해상도로 예측을 개선함으로써, 재학습 없이도 1024×1024 해상도 이미지에서 최신 기술 수준의 성능을 달성하며, 기존 방법에 비해 구조적 일관성과 질감 세부 정보를 크게 향상시킨다.

ABSTRACT

In this paper, we address the problem of degradation in inpainting quality of neural networks operating at high resolutions. Inpainting networks are often unable to generate globally coherent structures at resolutions higher than their training set. This is partially attributed to the receptive field remaining static, despite an increase in image resolution. Although downscaling the image prior to inpainting produces coherent structure, it inherently lacks detail present at higher resolutions. To get the best of both worlds, we optimize the intermediate featuremaps of a network by minimizing a multiscale consistency loss at inference. This runtime optimization improves the inpainting results and establishes a new state-of-the-art for high resolution inpainting. Code is available at: https://github.com/geomagical/lama-with-refiner/tree/refinement.

연구 동기 및 목표

  • 제한된 유효 수용장역으로 인해 고해상도에서 복원 품질이 열화되는 문제를 해결하기 위해.
  • 기본 네트워크를 재학습하지 않고도 고해상도 복원에서 전반적인 구조와 질감 세부 정보를 향상시키기 위해.
  • 저해상도 예측을 가이던스로 활용하여 고해상도 복원에서 더 높은 일관성과 선명도를 달성하기 위해.
  • 기존 최신 기술 수준의 복원 모델과 호환되는 런타임 개선 기법을 개발하기 위해.

제안 방법

  • 네트워크의 훈련 해상도(512px)에서 시작하여 내림샘플링 요소가 2인 이미지 피라미드를 구축한다. 이는 1024px까지 확장된다.
  • 가장 낮은 해상도에서 단일 전방향 추론을 수행하여 초도 복원 예측을 생성한다.
  • 각 더 높은 해상도에서, 네트워크의 '앞부분'(에코더)에서 특징 맵을 최적화한다. 이때 Adam 최적화기를 사용하며 학습률는 0.002로 설정하고 15회 반복한다.
  • 내림샘플링된 고해상도 예측과 저해상도 예측 간의 L1 손실을 최소화한다. 이 손실은 마스크된 영역에만 적용된다.
  • 과적합을 방지하기 위해 손실 계산 이전에 마스크를 침식(15px 원형 커널)한다.
  • 아날로그 왜곡을 방지하고 스무스한 특징 전달을 확보하기 위해 내림샘플링에 가우시안 필터를 적용한 후 양방향 보간을 수행한다.

실험 결과

연구 질문

  • RQ1재학습 없이 추론 중 특징 맵 최적화가 고해상도 이미지 복원 성능을 향상시킬 수 있는가?
  • RQ2저해상도 예측을 가이던스로 사용할 경우 고해상도 출력에서 구조적 일관성과 세부 정보가 향상되는가?
  • RQ31024×1024 해상도에서 FID 및 LPIPS 지표 측면에서 다중 해상도 개선 기법이 최신 기술 수준의 방법과 비교해 어떻게 성능을 내는가?
  • RQ4반복적 개선을 적용할 경우 추론 시간과 성능 향상 사이의 상충 관계는 어떠한가?
  • RQ5네트워크 독립적인 런타임 개선 기법이 고해상도 복원 벤치마크에서 기존 방법을 능가할 수 있는가?

주요 결과

  • 제안된 방법은 1024×1024 해상도 이미지에서 최신 기술 수준의 FID 점수를 달성하였으며, 중간 브러시 기준 19.864, 두꺼운 브러시 기준 26.401을 기록하여 Big-LaMa 및 기타 최신 기술 수준의 방법을 능가하였다.
  • LPIPS 점수는 중간 브러시 기준 0.115, 두꺼운 브러시 기준 0.135로 감소하여 지표 이미지와의 인지적 유사도가 향상됨을 나타냈다.
  • 미세한 브러시의 경우 충분한 맥락 정보가 존재해 기초 모델이 잘 작동하므로 Big-LaMa와 유사한 성능(13.193)을 보였다.
  • 특히 큰 마스크가 있는 복잡한 영역에서 질감의 선명도와 전반적인 구조적 일관성이 크게 향상되었다.
  • 다중 해상도 스케일을 거쳐 여러 번의 전방/역전파를 수행함에 따라 추론 시간이 4.56초로 증가하였다(비교 기준 Big-LaMa는 0.26초).
  • 역전파 동안 기울기 저장으로 인해 메모리 사용량이 증가하여 최대 GPU 호환 해상도가 제한되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.