[논문 리뷰] Resolution-robust Large Mask Inpainting with Fourier Convolutions
이 논문은 빠른 푸리에 컨벌루션(FFCs)을 사용하여 초기 네트워크 레이어에서 전체 이미지 수용장역을 달성하는 해상도에 강건한 단일 단계 이미지 복원 방법인 LaMa를 제안한다. FFC 기반 아키텍처, 고수용장역 퍼셉추얼 손실, 그리고 공격적인 대량 마스크 데이터 증강을 결합함으로써 LaMa는 대규모 마스크에서 최고 성능을 기록하고, 훈련 중에 볼 수 없었던 더 높은 해상도로도 효과적으로 일반화되며, 이전 방법보다 파rameter 수와 추론 비용이 적다.
Modern image inpainting systems, despite the significant progress, often struggle with large missing areas, complex geometric structures, and high-resolution images. We find that one of the main reasons for that is the lack of an effective receptive field in both the inpainting network and the loss function. To alleviate this issue, we propose a new method called large mask inpainting (LaMa). LaMa is based on i) a new inpainting network architecture that uses fast Fourier convolutions (FFCs), which have the image-wide receptive field; ii) a high receptive field perceptual loss; iii) large training masks, which unlocks the potential of the first two components. Our inpainting network improves the state-of-the-art across a range of datasets and achieves excellent performance even in challenging scenarios, e.g. completion of periodic structures. Our model generalizes surprisingly well to resolutions that are higher than those seen at train time, and achieves this at lower parameter&time costs than the competitive baselines. The code is available at \url{https://github.com/saic-mdal/lama}.
연구 동기 및 목표
- 기존 복원 모델이 대규모 마스크와 복잡한 구조를 처리하는 데에 한계를 보이는 문제를 해결하기 위해, 특히 고해상도 환경에서의 성능을 향상시키기 위해.
- 표준 컨벌루션 네트워크와 퍼셉추얼 손실에서의 부족한 유효 수용장역으로 인해 전반적인 구조 이해가 어려운 문제를 해결하기 위해.
- 이중 단계 또는 복잡한 아키텍처보다 성능이 뛰어나면서도 계산 비용을 줄인 단일 단계 복원 프레임워크를 개발하기 위해.
- 고해상도 훈련 데이터가 필요 없이도 고해상도 이미지로의 일반화를 가능하게 하기 위해.
제안 방법
- 빠른 푸리에 컨벌루션(FFCs) 기반의 피드포워드, ResNet 유사 생성망 네트워크를 사용하여 초기 레이어에서도 이미지 전반의 수용장역을 제공한다.
- 큰 컨텍스트를 가진 의미적 세그멘테이션 백본을 기반으로 한 고수용장역 퍼셉추얼 손실을 사용하여 전반적인 형태와 구조의 일관성을 강제한다.
- 모델과 손실 함수의 고수용장역을 최대한 활용하기 위해 넓고 크며 다양한 훈련 마스크를 생성하는 공격적인 마스크 생성 전략을 사용한다.
- 다중 구성 요소 손실을 사용하여 훈련을 수행하며, 이는 판별자에 r1 정규화가 적용된 패치GAN 기반의 적대적 손실, 퍼셉추얼 손실, 특징 매칭 손실을 포함한다.
- 입력은 마스크 처리된 이미지와 이진 마스크를 겹쳐서 구성한 사차원 텐서이며, 이는 네트워크가 누락된 영역에 주의를 기울일 수 있도록 한다.
- 아키텍처는 유일하게 저해상도(256×256) 데이터로 훈련되지만 추론 시 더 높은 해상도로도 효과적으로 일반화된다.
실험 결과
연구 질문
- RQ1중간 단계의 감독 없이도 복잡한 설계 없이 대규모 마스크에서 최고 성능을 내는 단일 단계 이미지 복원 모델이 가능한가?
- RQ2푸리에 컨벌루션 기반 고수용장역 아키텍처는 훈련 중에 볼 수 없었던 고해상도 이미지로의 일반화를 어떻게 향상시키는가?
- RQ3큰 컨텍스트를 가진 퍼셉추얼 손실이 복원 과정에서 전반적인 이미지 구조를 얼마나 잘 모델링하는가?
- RQ4공격적인 대규모 마스크 데이터 증강은 고수용장역 구성 요소를 효과적으로 활용할 수 있도록 모델 능력을 얼마나 높이는가?
- RQ5표준 컨벌루션에 비해 FFC 기반 네트워크는 주기적 또는 반복적인 시각적 패턴을 더 잘 포착하고 생성할 수 있는가?
주요 결과
- LaMa는 여러 벤치마크 데이터셋에서 최고 성능을 기록하며, 특히 도전적인 대규모 마스크 및 복잡한 구조 시나리오에서도 뛰어난 성능을 보였다.
- 모델은 256×256 이미지로만 훈련되었음에도 불구하고 4K 해상도까지 놀랍게 잘 일반화되어 해상도에 강건함을 입증했다.
- LaMa는 이전 방법이 자주 잘 처리하지 못하는 주기적이고 반복적인 구조에서 뛰어난 결과를 내었다.
- DCT-Net 및 SIREN과 같은 경쟁 모델 대비 30-50% 적은 파라미터를 사용하고 추론 시간도 더 짧았다.
- 제거 실험을 통해 FFC 아키텍처, 고수용장역 손실, 공격적인 마스크 생성 각 요소가 성능 향상에 기여한다는 것이 확인되었다.
- 자유형 및 물체 형태의 마스크에서도 강력한 성능을 유지하여 마스크 다양성에 대한 강건성을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.