[논문 리뷰] MISF: Multi-level Interactive Siamese Filtering for High-Fidelity Image Inpainting
이 논문은 두 가지 상호 연결된 브랜치인 커널 예측 브랜치(KPB)와 의미 및 이미지 필터링 브랜치(SIFB)를 통해 동적 이미지 수준 및 의미 수준의 필터링을 동시에 수행하는 새로운 이미지 복원 프레임워크인 다중 수준 상호작용 시아모닉 필터링(MISF)을 제안한다. 적응형이고 맥락 인식 가능한 필터링 커널 및 다중 수준 특징 융합을 활용함으로써 MISF는 당도, 플레이스2, 세레브아 데이터셋에서 최신 기준 성능을 달성하며, 다양한 부족 영역과 장면 유형에서 잡음과 왜곡을 크게 감소시키고 정밀도를 향상시킨다.
Although achieving significant progress, existing deep generative inpainting methods are far from real-world applications due to the low generalization across different scenes. As a result, the generated images usually contain artifacts or the filled pixels differ greatly from the ground truth. Image-level predictive filtering is a widely used image restoration technique, predicting suitable kernels adaptively according to different input scenes. Inspired by this inherent advantage, we explore the possibility of addressing image inpainting as a filtering task. To this end, we first study the advantages and challenges of image-level predictive filtering for image inpainting: the method can preserve local structures and avoid artifacts but fails to fill large missing areas. Then, we propose semantic filtering by conducting filtering on the deep feature level, which fills the missing semantic information but fails to recover the details. To address the issues while adopting the respective advantages, we propose a novel filtering technique, i.e., Multilevel Interactive Siamese Filtering (MISF), which contains two branches: kernel prediction branch (KPB) and semantic & image filtering branch (SIFB). These two branches are interactively linked: SIFB provides multi-level features for KPB while KPB predicts dynamic kernels for SIFB. As a result, the final method takes the advantage of effective semantic & image-level filling for high-fidelity inpainting. We validate our method on three challenging datasets, i.e., Dunhuang, Places2, and CelebA. Our method outperforms state-of-the-art baselines on four metrics, i.e., L1, PSNR, SSIM, and LPIPS. Please try the released code and model at https://github.com/tsingqguo/misf.
연구 동기 및 목표
- 기존의 딥 제너레이티브 복원 방법은 다양한 장면과 부족 영역 형태에서 일반화 능력이 떨어지고 잡음이 발생하는 등의 한계를 해결하고자 한다.
- 지역적 구조를 유지하면서 잡음을 줄이기 위한 이미지 수준 예측 필터링의 잠재력을 탐색하고, 동시에 큰 영역의 부족을 메우는데 어려움을 겪는 한계를 극복하고자 한다.
- 예측 필터링을 깊이 있는 특징 수준(의미 수준)으로 확장하여 세부 정보 손실이 있더라도 대규모 의미적 콘텐츠를 복원하고자 한다.
- 이미지 수준과 의미 수준의 필터링을 상호작용적이고 다중 수준의 시아모닉 아키텍처를 통해 통합함으로써 정밀도와 일반화 능력을 향상시키고자 한다.
- 상호작용적 필터링을 통한 동적 컨볼루션 연산이 기존의 인코더-디코더 네트워크보다 성능을 크게 향상시킬 수 있음을 입증하고자 한다.
제안 방법
- MISF는 상호작용적인 두 개의 병렬 브랜치인 커널 예측 브랜치(KPB)와 의미 및 이미지 필터링 브랜치(SIFB)를 사용하며, 이들이 다중 수준 특징과 동적 커널을 교환한다.
- KPB는 SIFB의 다중 수준 특징과 입력 이미지를 기반으로 적응형이고 공간적으로 변화하는 필터링 커널을 예측하여 맥락 인식 필터링을 가능하게 한다.
- SIFB는 픽셀 수준과 깊이 있는 특징 수준에서 필터링을 수행한다: 이미지 수준 필터링은 세부 구조를 복원하고, 의미 수준 필터링은 고수준 표현을 이용해 큰 영역의 부족을 복원한다.
- KPB와 SIFB 간의 상호작용은 이중 방향적이다. SIFB는 다중 수준 특징을 제공하여 커널 예측을 안내하고, KPB는 동적 커널을 제공하여 특징 및 픽셀 재구성을 정밀하게 개선한다.
- 이 프레임워크는 인접한 픽셀과 특징 간의 매끄러움 선호도를 명시적으로 모델링하여, 제너레이티브 모델링에만 의존하지 않고도 고정밀 재구성을 가능하게 한다.
- L1, PSNR, SSIM, LPIPS 지표를 사용하여 엔드 투 엔드로 학습하며, 구성 요소의 기여도를 검증하기 위해 추론 분석을 실시한다.
실험 결과
연구 질문
- RQ1이미지 수준의 예측 필터링은 이미지 복원에서 잡음을 효과적으로 줄이고 국소적 구조를 유지하는 데 유의미한가? 그리고 큰 영역의 부족을 처리하는 데에는 어떤 한계가 있는가?
- RQ2깊이 있는 특징 수준에서 의미 수준 필터링을 통해 대규모 부족 콘텐츠를 성공적으로 복원할 수 있는가? 세부 정보의 정밀도가 손실되는가?
- RQ3이미지 수준과 의미 수준의 필터링을 어떻게 효과적으로 통합하여 고정밀 세부 구조 복원과 강력한 의미적 완성도를 동시에 달성할 수 있는가?
- RQ4기존의 제너레이티브 네트워크에 비해 MISF의 상호작용적이고 다중 수준 아키텍처는 다양한 장면과 마스크 형태에서 일반화 능력을 얼마나 향상시키는가?
- RQ5인코더-디코더 아키텍처에서 고정 또는 단일 수준 필터링에 비해, 상호작용적 필터링을 통해 학습된 동적 컨볼루션 연산의 기여도는 어떠한가?
주요 결과
- MISF는 당도, 플레이스2, 세레브아 세 데이터셋에서 L1, PSNR, SSIM, LPIPS의 네 가지 지표 전반에서 최신 기준 성능을 초월한다.
- 당도 데이터셋에서 MISF는 F3 특징 수준에서 L1 손실 0.488, PSNR 1.651, SSIM 3.895, LPIPS 0.0343을 기록하여 뛰어난 성능을 입증한다.
- 추론 분석 결과, MISF를 통한 이미지 수준과 의미 수준 필터링의 조합은 각각의 방법을 별도로 사용할 때보다 더 우수한 성능을 내며, 모든 지표와 마스크 크기에서 MISF는 Img-Filter 및 Sem-Filter를 일관되게 능가한다.
- 유사도 분석 결과, MISF 필터링 후 특징이 진짜 값에 더 가까워지며, 특히 마스크 비율이 증가할수록 뚜렷하게 향상됨을 확인하여 필터링 메커니즘의 효과를 입증한다.
- En-decoder, En-decoder-Filter, Sem-Filter, MISF 간의 추론 비교 결과, 더 동적이고 유연한 컨볼루션 연산(즉, MISF)이 더 뛰어난 성능을 내며, 상호작용적이고 다중 수준 필터링의 중요성을 입증한다.
- 정성적 결과는 RFRNet과 JPGNet에 비해 MISF가 더 자연스럽고 고정밀한 이미지를 생성하며, 특히 큰 영역의 부족이나 복잡한 장면에서 더 풍부한 세부 정보와 더 적은 잡음을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.