Skip to main content
QUICK REVIEW

[논문 리뷰] Spatially-Attentive Patch-Hierarchical Network for Adaptive Motion Deblurring

Maitreya Suin, Kuldeep Purohit|arXiv (Cornell University)|2020. 04. 11.
Advanced Image Processing Techniques참고 문헌 26인용 수 15
한 줄 요약

이 논문은 동적 장면에서 공간적으로 변화하는 운동 흐림을 다루기 위해 픽셀별로 필터와 수신 영역을 적응적으로 조절하는 공간적 주의 메커니즘을 갖춘 패치-계층적 네트워크를 제안한다. 콘텐츠 인식형 글로벌-로컬 주의 및 동적 필터 학습을 통합함으로써, 이전의 CNN 기반 방법들에 비해 더 높은 속도와 효율성을 확보하면서도 최신 기술 수준의 복원 성능을 달성한다.

ABSTRACT

This paper tackles the problem of motion deblurring of dynamic scenes. Although end-to-end fully convolutional designs have recently advanced the state-of-the-art in non-uniform motion deblurring, their performance-complexity trade-off is still sub-optimal. Existing approaches achieve a large receptive field by increasing the number of generic convolution layers and kernel-size, but this comes at the expense of of the increase in model size and inference speed. In this work, we propose an efficient pixel adaptive and feature attentive design for handling large blur variations across different spatial locations and process each test image adaptively. We also propose an effective content-aware global-local filtering module that significantly improves performance by considering not only global dependencies but also by dynamically exploiting neighbouring pixel information. We use a patch-hierarchical attentive architecture composed of the above module that implicitly discovers the spatial variations in the blur present in the input image and in turn, performs local and global modulation of intermediate features. Extensive qualitative and quantitative comparisons with prior art on deblurring benchmarks demonstrate that our design offers significant improvements over the state-of-the-art in accuracy as well as speed.

연구 동기 및 목표

  • 이미지 전반에 걸쳐 공간적으로 변화하는 블러가 발생하는 동적 장면에서 비균일한 운동 흐림을 다루는 데 목적이 있다.
  • 고정된, 공간적으로 불변하는 필터를 사용하는 딥 컨볼루션 네트워크의 한계를 극복하여 높은 계산 비용과 최적화되지 않은 성능을 개선하고자 한다.
  • 로컬 블러 특성에 기반해 수신 영역과 필터 가중치를 동적으로 조정하는 효율적인 아키텍처를 설계하고자 한다.
  • 적응형 주의 및 계층적 특징 학습을 활용하여 단일 이미지 복원에서 정확도-속도 트레이드오프를 향상시키고자 한다.

제안 방법

  • 멀티스케일에서 이미지를 처리할 수 있도록 패치-계층적 인코더-디코더 아키텍처를 사용하여 효과적인 국소 및 글로벌 특징 학습을 가능하게 한다.
  • 콘텐츠 인식형 글로벌-로컬 필터링(PDF) 모듈은 지역 블러 콘텐츠에 기반해 필터 가중치와 공간적 오프셋을 동적으로 조정함으로써 방향성 있는 적응형 필터링을 가능하게 한다.
  • 다양한 스케일 간의 특징 전파 및 표현 학습을 향상시키기 위해 인코더와 디코더 레벨 간에 크로스-어텐션(CA) 블록을 사용한다.
  • PDF 모듈은 적응형 가중치와 오프셋을 사용하여 공간적으로 변화하는 필터를 학습함으로써 네트워크가 이미지 내 주요 운동 방향에 맞추어 정렬되도록 한다.
  • 각 스테이지 내부에 자기 주의(self-attention) 메커니즘을 적용하여 장거리 의존성을 캡처하고 특징 표현을 향상시킨다.
  • 융합 마스크는 자기 주의 브랜치와 동적 필터링 브랜치의 출력을 지역 블러 복잡도에 따라 적응적으로 통합한다.

실험 결과

연구 질문

  • RQ1딥 러닝 기반 복원 모델이 공간적 위치별로 필터 파rameter와 수신 영역을 적응적으로 조정함으로써 더 높은 정확도와 효율성을 달성할 수 있는가?
  • RQ2고정된 균일한 컨볼루션 레이어에 비해 콘텐츠 인식형 공간적 가변 필터링은 복잡한 비균일 운동 흐림을 다룰 때 어떻게 성능이 우월한가?
  • RQ3글로벌-로컬 주의 및 크로스-어텐션 메커니즘은 특징 표현 및 복원 성능 향상에 어느 정도 기여하는가?
  • RQ4적응형 필터링과 주의 메커니즘의 융합이 복원 작업에서 상호보완적인 성능 향상을 이끌어내는가?
  • RQ5제안된 방법은 정확성과 계산 효율성을 동시에 확보하여 실세계의 운동 흐림 이미지에 대해 실시간 추론을 가능하게 하는가?

주요 결과

  • 제안된 방법은 리얼월드 데블러링 벤치마크에서 PSNR 30.76을 기록하여 이전 최신 기술 수준의 방법들을 능가한다.
  • 이전의 엔드 투 엔드 CNN 기반 데블러닝 네트워크에 비해 뛰어난 추론 속도와 더 작은 계산 부하를 보였다.
  • 시각화 결과 주의 맵이 주로 블러 영역과 강하게 상관관계가 있음을 확인하여 네트워크가 관련 영역에 집중할 수 있음을 입증한다.
  • 동적 필터 모듈은 합성 PSF 각도(예: 0°, 45°, 90°, 135°에 대응하는 11°, 50°, 81°, 126°)와 매우 유사한 오프셋 방향을 추정함으로써 방향성 적응 가능성의 타당성을 검증한다.
  • 절단 실험 결과, PDF 모듈과 크로스-어텐션의 조합이 각각 단독으로 사용할 경우보다 더 뛰어난 성능을 내는 것으로 나타났다.
  • 융합 마스크는 고블러 영역(예: 움직이는 물체)에서는 동적 필터링 브랜치를 우선 선택하고, 균일한 영역에서는 주의 브랜치를 선호함으로써 맥락 기반 의사결정 능력을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.