[논문 리뷰] Incremental Transformer Structure Enhanced Image Inpainting with Masking Positional Encoding
이 논문은 ZITS라는 증분형 Transformer 기반 이미지 복원 프레임워크를 제안하며, 엣지와 선에서 유도된 저해상도 회색조 스케치 공간을 학습하여 구조 복원을 향상시킵니다. 이 스케치 공간은 Transformer 기반 복원기 구조를 통해 정규화되고, Zero-initialized Residual Addition를 사용하여 사전 학습된 모델과 통합됩니다. 새로운 마스킹 위치 인코딩(Masking Positional Encoding, MPE)은 큰 비정규형 마스크에서 성능을 향상시켜, LaMa와 같은 SOTA 방법에 비해 구조 유지 능력이 뛰어나고 블러가 감소한 1024×1024 이미지에서 최고 성능을 기록합니다.
Image inpainting has made significant advances in recent years. However, it is still challenging to recover corrupted images with both vivid textures and reasonable structures. Some specific methods only tackle regular textures while losing holistic structures due to the limited receptive fields of convolutional neural networks (CNNs). On the other hand, attention-based models can learn better long-range dependency for the structure recovery, but they are limited by the heavy computation for inference with large image sizes. To address these issues, we propose to leverage an additional structure restorer to facilitate the image inpainting incrementally. The proposed model restores holistic image structures with a powerful attention-based transformer model in a fixed low-resolution sketch space. Such a grayscale space is easy to be upsampled to larger scales to convey correct structural information. Our structure restorer can be integrated with other pretrained inpainting models efficiently with the zero-initialized residual addition. Furthermore, a masking positional encoding strategy is utilized to improve the performance with large irregular masks. Extensive experiments on various datasets validate the efficacy of our model compared with other competitors. Our codes are released in https://github.com/DQiaole/ZITS_inpainting.
연구 동기 및 목표
- 큰 비정규형 마스크를 가진 고해상도 이미지에서 현실적인 텍스처와 통합된 구조를 복원하는 데 도전합니다.
- CNN이 장거리 의존성을 포착하는 데 한계가 있고, 이미지 복원에서 전체 스케일의 Transformer가 높은 계산 비용을 유발하는 문제를 해결합니다.
- 마스킹된 영역에 명시적인 위치 정보를 통합하여 약한 텍스처와 복잡한 구조적 장면에서의 성능을 향상시킵니다.
- 전체 재학습 없이도 사전 학습된 복원 모델에 구조적 사전 지식를 효율적으로 통합할 수 있도록 합니다.
제안 방법
- 엣지와 선에서 유도된 저해상도 회색조 스케치 공간에서 통합된 구조를 학습하기 위해 교차하는 축 방향 및 표준 어텐션 블록을 갖춘 Transformer 구조 복원기(Transformer Structure Restorer, TSR)를 사용합니다.
- 이 스케치 공간은 4층의 CNN을 통해 업샘플링되어 고해상도에서의 구조적 세부 정보를 유지합니다.
- 가중치가 있는 컨볼루션을 갖춘 구조 특징 인코더(Structure Feature Encoder, SFE)가 Zero-initialized Residual Addition(ZeroRA)를 사용하여 Fast Fourier Convolution(FFC)-기반 복원 모델에 구조적 특징을 융합합니다.
- 새로운 마스킹 위치 인코딩(Masking Positional Encoding, MPE)은 마스크되지 않은 영역에서 마스크된 영역으로의 거리와 방향을 인코딩하여, 큰 비정규형 마스크에서 복원 정밀도를 향상시킵니다.
- 이 프레임워크는 증분 학습이 가능하여 사전 학습된 모델의 빠른 수렴과 효율적 적응을 가능하게 합니다.
- 이 방법은 엔드 투 엔드로 학습되며, 재학습 없이도 최대 2048×2048 해상도의 이미지에 적용할 수 있습니다.
![Figure 1 : High quality 1024 $\times$ 1024 inpainted results. From left to right, masked inputs, results of LaMa [ 45 ] , results of our method.](https://ar5iv.labs.arxiv.org/html/2203.00867/assets/x1.png)
실험 결과
연구 질문
- RQ1주 모델의 재학습 없이도 경량의 증분형 Transformer 기반 구조 복원기가 통합된 구조 복원을 향상시킬 수 있는가?
- RQ2표준 위치 인코딩에 비해 마스킹 위치 인코딩(MPE)은 큰 비정규형 마스크에서 성능을 어떻게 향상시키는가?
- RQ3엣지와 와이어프레임에서 파생된 정규화된 회색조 스케치 공간이 고해상도 구조 복원을 효과적으로 안내할 수 있는가?
- RQ4ZeroRA 기반 통합 전략은 전체 미세조정에 비해 더 빠른 수렴과 향상된 성능을 달성할 수 있는가?
주요 결과
- 40% 중심 직사각형 마스크를 가진 1k Places(512) 데이터셋에서 제안된 방법은 PSNR 19.65, FID 55.85, LPIPS 0.239를 기록했으며, FID와 LPIPS에서 Co-Mod와 LaMa를 모두 앞서며 PSNR는 동률을 기록했습니다.
- 1024×1024 MatterPort3D 이미지에서, 특히 약한 텍스처와 복잡한 기하학적 구조를 가진 장면에서 LaMa에 비해 더 일관되고 구조적으로 정확한 결과를 도출했습니다.
- Indoor 및 Places2 데이터셋에서의 사용자 연구에서, 각각 72.3%와 74.1%의 비교에서 참가자들이 이 방법을 최고로 평가했으며, LaMa를 크게 앞섰습니다.
- 강한 주기적 패턴을 가진 512×512 텍스처 이미지에서, PSNR 25.67과 FID 11.67을 기록했으며, FID와 LPIPS에서 LaMa에 비해 약간 우수했습니다.
- 2048×2048 이미지에서, LaMa에 비해 일관된 구조 유지와 블러 감소를 유지하여 초고해상도에 대한 확장성을 입증했습니다.
- 복잡한 도시 환경의 먼 거리 시점에서는 스케치 공간의 해상도가 제한되어(256×256) 구조적 세부 정보를 포착하지 못해 실패한 경우가 있었으며, 이는 먼 거리의 구조적 세부 정보를 포착하는 데 한계가 있음을 시사합니다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.