Skip to main content
QUICK REVIEW

[논문 리뷰] Image Inpainting with Edge-guided Learnable Bidirectional Attention Maps

Dongsheng Wang, Chaohao Xie|arXiv (Cornell University)|2021. 04. 25.
Generative Adversarial Networks and Image Synthesis참고 문헌 54인용 수 5
한 줄 요약

이 논문은 예측된 에지로 유도되는 학습 가능한 이중 방향 주의 맵을 사용하여 비정규 구멍에서의 구조적 일관성 향상과 뿌연 현상 감소를 위한 새로운 이미지 복원 프레임워크 Edge-LBAM을 제안한다. 하드 0-1 마스크를 대체하여 엔드 투 엔드로 훈련 가능한 주의 맵을 도입하고 에지 인식 마스크 업데이트를 통합함으로써 Edge-LBAM은 기준 데이터셋에서 정량적 지표와 시각적 품질 측면에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

For image inpainting, the convolutional neural networks (CNN) in previous methods often adopt standard convolutional operator, which treats valid pixels and holes indistinguishably. As a result, they are limited in handling irregular holes and tend to produce color-discrepant and blurry inpainting result. Partial convolution (PConv) copes with this issue by conducting masked convolution and feature re-normalization conditioned only on valid pixels, but the mask-updating is handcrafted and independent with image structural information. In this paper, we present an edge-guided learnable bidirectional attention map (Edge-LBAM) for improving image inpainting of irregular holes with several distinct merits. Instead of using a hard 0-1 mask, a learnable attention map module is introduced for learning feature re-normalization and mask-updating in an end-to-end manner. Learnable reverse attention maps are further proposed in the decoder for emphasizing on filling in unknown pixels instead of reconstructing all pixels. Motivated by that the filling-in order is crucial to inpainting results and largely depends on image structures in exemplar-based methods, we further suggest a multi-scale edge completion network to predict coherent edges. Our Edge-LBAM method contains dual procedures,including structure-aware mask-updating guided by predict edges and attention maps generated by masks for feature re-normalization.Extensive experiments show that our Edge-LBAM is effective in generating coherent image structures and preventing color discrepancy and blurriness, and performs favorably against the state-of-the-art methods in terms of qualitative metrics and visual quality.

연구 동기 및 목표

  • 비정규 구멍을 처리할 때 표준 및 부분 복원 기법이 자주 색상 불일치와 뿌연 결과를 초래하는 한계를 해결하기 위해.
  • 고정된 0-1 마스크를 학습 가능한 주의 맵으로 대체하여 엔드 투 엔드로 훈련 가능한 방식으로 마스크 업데이트 및 특징 재정규화를 향상시키기 위해.
  • 예측된 에지를 사용하여 채우기 과정을 구조 인식적으로 만들음으로써 복원 성능 향상시키기 위해.
  • 더 나은 특징 전파와 재구성 효과를 위해 정방향 및 역방향 주의 맵을 포함한 이중 방향 주의 메커니즘 개발하기 위해.
  • 다중 척도 에지 예측을 주의 기반 특징 정련과 통합하여 더 구조적으로 일관되고 현실적인 이미지 완성 도출하기 위해.

제안 방법

  • 부분 복원에서 하드 0-1 마스크를 대체하기 위해 동적 특징 재정규화 및 마스크 업데이트를 위한 소프트하고 학습 가능한 주의 맵인 학습 가능한 정방향 주의 맵(LFAM)을 도입한다.
  • 재구성 과정에서 누락된 영역을 강조하기 위해 디코더에 학습 가능한 역방향 주의 맵(LRAM)을 제안하여 훈련 안정성과 생성 품질 향상에 기여한다.
  • 입력에서 일관된 에지를 예측하기 위해 다중 척도 에지 완성 네트워크(MCENet)를 활용하여 인코더에서 구조 인식 마스크 업데이트를 유도한다.
  • 예측된 에지 맵을 사용하여 마스크 업데이트 및 주의 분포를 제약하는 Edge-LFAM 및 Edge-LRAM을 도입하여 채우기 과정이 구조적 윤곽을 따르도록 보장한다.
  • 주의 맵을 엔드 투 엔드로 학습하고 에지 감독을 통합하여 향상된 특징 학습을 위한 인코더-디코더 설계를 가진 이중 경로 아키텍처를 사용한다.
  • 주의 모듈에서 적응형 활성화 함수 $g_A(\cdot)$ 와 $g_M(\cdot)$ 를 적용하여, 아블레이션 연구에서 표준 Sigmoid 및 ReLU보다 뛰어난 성능을 보였다.

실험 결과

연구 질문

  • RQ1학습 가능한 주의 맵이 비정규 구멍 복원에서 하드 0-1 마스크를 대체하여 특징 재정규화 및 마스크 업데이트를 향상시킬 수 있는가?
  • RQ2에지 유도 마스크 업데이트가 생성된 이미지의 구조 일관성 향상과 뿌연 현상 감소에 어떤 영향을 미치는가?
  • RQ3양방향 주의 메커니즘(정방향 및 역방향)이 이미지 복원에서 특징 전파 및 재구성에 기여하는가?
  • RQ4다중 척도 에지 예측을 주의 맵과 통합하면 더 구조 인식적이고 현실적인 복원 결과를 도출할 수 있는가?
  • RQ5주의 모듈 내 다양한 활성화 함수가 최종 복원 성능에 어떤 영향을 미치는가?

주요 결과

  • Edge-LBAM은 Paris StreetView 및 Places2 데이터셋에서 PConv, DeepFillv2, EdgeConnect 등의 기법보다 PSNR 및 SSIM 지표에서 최신 기술 수준의 성능을 달성한다.
  • 아블레이션 연구를 통해 제안된 $g_A(\cdot)$ 와 $g_M(\cdot)$ 활성화 함수가 특징 재정규화 및 마스크 업데이트에서 Sigmoid, ReLU 및 그 조합보다 뚜렷한 우수성을 보였다.
  • 시각화 결과에 따르면 Edge-LBAM의 마스크 업데이트는 구조 인식적이다: 구멍이 예측된 에지 방향으로 수축하여 일관된 구조적 완성도를 가능하게 한다.
  • 역방향 주의 맵(LRAM)은 디코더가 알려지지 않은 영역에 집중하도록 효과적으로 작용하며, 알려진 영역보다 구멍 영역에서 더 높은 주의 값이 나타난다.
  • 공간적 맥락과 구조적 단서에 따라 주의 맵을 학습함으로써 Edge-LBAM은 색상 불일치와 뿌연 현상을 감소시킨다.
  • 질적 비교 및 정량적 지표를 통한 검증을 통해 다양한 비정규 구멍 형태와 복잡한 무늬에 대해 뛰어난 강인성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.