[논문 리뷰] Stripformer: Strip Transformer for Fast Image Deblurring
Stripformer는 수평 및 수직 스트립 내부와 스트립 간의 상호작용을 고려한 인터레이스드 인tra-stripped 및 인터-stripped 자기주의 메커니즘을 사용하여 다양한 방향성과 크기의 영역별 블러 패턴을 포착하는 토큰 및 파라미터 효율적인 트랜스포머 아키텍처를 제안한다. 이는 기존 트랜스포머에 비해 상당히 감소된 FLOPs와 추론 시간을 바탕으로 GoPro, HIDE, RealBlur 데이터셋에서 최신 기술 수준의 성능을 달성한다.
Images taken in dynamic scenes may contain unwanted motion blur, which significantly degrades visual quality. Such blur causes short- and long-range region-specific smoothing artifacts that are often directional and non-uniform, which is difficult to be removed. Inspired by the current success of transformers on computer vision and image processing tasks, we develop, Stripformer, a transformer-based architecture that constructs intra- and inter-strip tokens to reweight image features in the horizontal and vertical directions to catch blurred patterns with different orientations. It stacks interlaced intra-strip and inter-strip attention layers to reveal blur magnitudes. In addition to detecting region-specific blurred patterns of various orientations and magnitudes, Stripformer is also a token-efficient and parameter-efficient transformer model, demanding much less memory usage and computation cost than the vanilla transformer but works better without relying on tremendous training data. Experimental results show that Stripformer performs favorably against state-of-the-art models in dynamic scene deblurring.
연구 동기 및 목표
- 기존의 사전 지식이나 표준 CNN으로는 모델링하기 어려운 동적 영상에서의 비균일하고 영역별로 특화된 운동 블러 문제를 해결한다.
- 이미지 블러링에서 기존 트랜스포머의 높은 메모리 및 계산 비용을 완화하면서도 전역 및 국소적 특징 모델링 능력을 유지한다.
- 구조화된 토큰화 및 주의 메커니즘을 통해 블러 방향성과 크기를 효율적으로 포착하는 하이브리드 트랜스포머 아키텍처를 설계한다.
- ImageNet과 같은 대규모 사전 학습 데이터셋에 의존하지 않고 최신 기술 수준의 블러링 성능을 달성한다.
- 기본 성능 기준 데이터셋에서 높은 PSNR 성능을 유지하면서도 추론 시간, 파라미터 수, FLOPs 측면에서 모델 효율성을 확보한다.
제안 방법
- 이미지의 수평 및 수직 스트립 내부의 픽셀 간 상관관계를 모델링하는 인트라-스트립 주의(Inter-SA)를 도입하여 국소적 블러 특징을 포착한다.
- 스트립 간 상관관계를 모델링하는 인터-스트립 주의(Inter-SA)를 구현하여 수평 및 수직 방향에서 전역적 영역 기반의 블러 패턴을 인코딩한다.
- 스케일에 따라 점진적으로 블러 크기와 방향성을 드러내기 위해 인트라-스트립 및 인터-스트립 주의 블록을 번갈아가며 스택한다.
- 고정된 위치 인코딩보다 성능을 향상시키기 위해 임의의 입력 크기를 지원하는 조건부 위치 인코딩(CPE)을 사용한다.
- 학습 중 대비 손실을 통합하여 특징의 분류 능력을 향상시키고 블러링 품질을 개선한다.
- 전체 특징 맵 자기주의를 피하기 위해 파라미터 및 메모리 효율성을 확보하여 1280×720 이미지 기준 약 6.9G의 FLOPs로 감소시켰다.
실험 결과
연구 질문
- RQ1구조화된 스트립 기반 토큰을 사용하는 하이브리드 트랜스포머 아키텍처가 계산 비용을 줄이면서도 기존 트랜스포머보다 이미지 블러링 성능에서 뛰어나게 작동할 수 있는가?
- RQ2인트라-스트립 및 인터-스트립 주의 메커니즘이 비균일한 운동 블러의 방향성과 크기 변화를 얼마나 효과적으로 포착할 수 있는가?
- RQ3제안된 주의 설계가 대규모 사전 학습 데이터 없이 블러링 성능을 얼마나 향상시킬 수 있는가?
- RQ4인트라-스트립 및 인터-스트립 주의의 조합이 Swin 또는 CCNet과 같은 다른 효율적인 주의 메커니즘보다 블러링 작업에서 어떻게 우월한가?
- RQ5조건부 위치 인코딩과 대비 손실의 조합이 실제 블러 데이터셋에서 블러링 성능을 추가로 향상시키는가?
주요 결과
- GoPro 데이터셋에서 Stripformer는 PSNR 33.08을 기록하여 DeblurGAN-v2, SRN, MPRNet, MIMO를 포함한 이전 최신 기술 수준의 방법들을 초월한다.
- HIDE 데이터셋에서 Stripformer는 PSNR 31.03을 달성하여 Swin과 Twins를 포함한 모든 비교 방법들을 능가하지만, 단지 20M 파라미터를 사용한다.
- 1280×720 이미지에서 FLOPs는 6.9G로 감소하고 추론 시간은 48ms로 단축되었으며, IPT(32G FLOPs)에 비해 상당히 낮게 유지하면서도 뛰어난 성능을 유지도한다.
- 절단 실험 결과, 인트라-스트립 및 인터-스트립 주의의 조합이 가장 높은 성능을 내며, CPE와 대비 손실이 결과를 추가로 향상시킨다.
- GoPro 및 HIDE에서 제안된 주의 메커니즘이 Swin, CCNet, Twins를 모두 초월하는 PSNR 성능을 기록하여 블러 방향성과 크기를 모델링하는 데 효과적임을 입증한다.
- ImageNet 사전 학습 없이도 Stripformer는 최신 기술 수준의 결과를 달성하여 데이터 효율성과 블러링 작업에 대한 강력한 인덕티브 바이어스를 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.