Skip to main content
QUICK REVIEW

[논문 리뷰] CSformer: Bridging Convolution and Transformer for Compressive Sensing

Dongjie Ye, Zhangkai Ni|arXiv (Cornell University)|2021. 12. 31.
Sparse and Compressive Sensing Techniques인용 수 10
한 줄 요약

CSformer는 압축 센싱 이미지 복원을 위한 하이브리드 딥 러닝 프레임워크를 제안한다. 이는 컨volutional 신경망(CNNs)과 비전 트랜스포머를 통합하여 구현된다. 이중 스템 아키텍처를 통해 동시에 작동하는 CNN 및 트랜스포머 브랜치를 활용하고, 점진적 특징 융합 및 윈도우 기반 어텐션을 적용함으로써, 효율적인 계산을 유지하면서도 이미지 복원 품질에서 최신 기술 수준(SOTA)의 성능을 달성한다. 이는 다양한 데이터셋과 샘플링 비율에서 기존 방법들을 능가한다.

ABSTRACT

Convolution neural networks (CNNs) have succeeded in compressive image sensing. However, due to the inductive bias of locality and weight sharing, the convolution operations demonstrate the intrinsic limitations in modeling the long-range dependency. Transformer, designed initially as a sequence-to-sequence model, excels at capturing global contexts due to the self-attention-based architectures even though it may be equipped with limited localization abilities. This paper proposes CSformer, a hybrid framework that integrates the advantages of leveraging both detailed spatial information from CNN and the global context provided by transformer for enhanced representation learning. The proposed approach is an end-to-end compressive image sensing method, composed of adaptive sampling and recovery. In the sampling module, images are measured block-by-block by the learned sampling matrix. In the reconstruction stage, the measurement is projected into dual stems. One is the CNN stem for modeling the neighborhood relationships by convolution, and the other is the transformer stem for adopting global self-attention mechanism. The dual branches structure is concurrent, and the local features and global representations are fused under different resolutions to maximize the complementary of features. Furthermore, we explore a progressive strategy and window-based transformer block to reduce the parameter and computational complexity. The experimental results demonstrate the effectiveness of the dedicated transformer-based architecture for compressive sensing, which achieves superior performance compared to state-of-the-art methods on different datasets.

연구 동기 및 목표

  • 압축 센싱에서 CNN의 장거리 상관관계 모델링 능력 부족과 트랜스포머의 국소적 공간적 세부 정보 캡처 능력 부족을 보완하기 위해.
  • 적응형 샘플링과 이미지 복원을 동시에 최적화하는 엔드 투 엔드 학습 가능한 프레임워크를 설계하기 위해.
  • CNN(국소적 인덕티브 바이어스)과 트랜스포머(전역적 맥락 모델링)의 상호보완적 강점을 활용하여 개선된 표현 학습을 이루기 위해.
  • 윈도우 기반 어텐션 메커니즘과 점진적 특징 해상도를 통해 트랜스포머 기반 CS 방법의 계산 복잡도를 감소시키기 위해.
  • 하이브리드 CNN-트랜스포머 아키텍처를 사용하여 딥 러닝 기반 압축 센싱의 새로운 SOTA 기준을 설정하기 위해.

제안 방법

  • 프레임워크는 이중 스템 네트워크를 활용한다: 한 쪽 스템은 국소적 이웃 관계를 모델링하기 위해 컨volution 레이어를 사용하고, 다른 쪽은 전역적 장거리 상관관계를 캡처하기 위해 비전 트랜스포머를 사용한다.
  • 두 스템의 특징은 다중 해상도에서 융합되어 보다 효과적인 상호보완적 표현 학습을 극대화한다.
  • 점진적 특징 정밀화 전략을 통해 해상도를 점차 증가시켜 메모리 및 계산 비용을 감소시킨다.
  • 윈도우 기반 트랜스포머 블록은 자기 어텐션 계산을 국소적 윈도우로 제한하여 FLOPs와 모델 크기를 크게 감소시킨다.
  • 측정 획득을 최적화하기 위해 블록 단위 적응형 샘플링 행렬을 학습하는 샘플링 모듈을 도입한다.
  • 샘플링 및 복원 단계를 동시에 최적화하기 위해 엔드 투 엔드 학습을 수행한다.

실험 결과

연구 질문

  • RQ1하이브리드 CNN-트랜스포머 아키텍처가 순수 CNN 또는 트랜스포머 기반 모델보다 압축 센싱 이미지 복원에서 뛰어난 성능을 낼 수 있는가?
  • RQ2CNN의 국소적 인덕티브 바이어스와 트랜스포머의 전역 맥락 모델링 능력을 단일 프레임워크 내에서 효과적으로 융합할 수 있는가?
  • RQ3점진적 특징 융합과 윈도우 기반 어텐션은 계산 효율성과 복원 품질에 어떤 영향을 미치는가?
  • RQ4이중 스템 설계는 단일 경로 트랜스포머 또는 CNN 전용 모델 대비 성능 및 일반화 능력에서 어떻게 비교되는가?
  • RQ5제안된 적응형 샘플링 전략은 다양한 샘플링 비율에서 복원 정밀도를 얼마나 향상시키는가?

주요 결과

  • CSformer는 모든 데이터셋과 샘플링 비율에서 최고의 PSNR 성능을 기록했으며, Direct Average 지표에서 50% 샘플링 비율일 때 AMP-Net 대비 1.32 dB, OPINE-Net 대비 1.39 dB 향상되었다.
  • Set5 데이터셋에서 50% CS 비율일 경우, CSformer는 43.55 dB의 PSNR를 기록했으며, AMP-Net(42.54 dB)과 OPINE-Net(42.12 dB)을 모두 능가했다.
  • 256×256 이미지의 추론 시간이 다소 높은 편(5.0765초)이지만, CSformer는 모델 크기를 6.71M 파라미터로 유지했으며, 이는 이중 경로 CNN을 사용하는 DPA-Net(9.78M) 대비 30% 작다.
  • 중심 커널 정렬 분석 결과, 초기 트랜스포머 특징은 깊은 CNN 특징과 유사함을 보였으며, 이는 트랜스포머가 조기에 장거리 상관관계를 캡처함을 시사한다. 반면 CNN는 이러한 모델링을 위해 깊은 스태킹이 필요하다.
  • 중간 및 깊은 레이어에서의 특징 융합 분석 결과 유사도가 중간 정도에서 약한 수준이었으며, 이는 이중 스템 설계가 국소적 및 전역적 표현을 효과적으로 균형 잡는다는 것을 확인한다.
  • 더 큰 COCO 데이터셋에서 재학습을 수행한 결과, CSformer는 재학습된 AMP-Net 및 OPINE-Net 대비 모든 평가 지표에서 최고의 성능을 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.