Skip to main content
QUICK REVIEW

[논문 리뷰] Spatial-Temporal Transformer for Video Snapshot Compressive Imaging

Lishun Wang, Miao Cao|arXiv (Cornell University)|2022. 09. 04.
Sparse and Compressive Sensing Techniques인용 수 10
한 줄 요약

이 논문은 공간-시간 자기주도 주의(attention)를 활용하여 장거리 상관관계를 모델링하는 영상 스냅샷 압축 촬영(Sci) 복원을 위한 STFormer이라는 공간-시간 트랜스포머 네트워크를 제안한다. 복잡한 고속 시나리오에서 30dB 이상의 PSNR 성능을 달성하며, 재학습 없이도 다양한 마스크 및 입력 크기를 지원하는 빠르고 종단 간 추론(2.7초 내 완료)을 가능하게 한다.

ABSTRACT

Video snapshot compressive imaging (SCI) captures multiple sequential video frames by a single measurement using the idea of computational imaging. The underlying principle is to modulate high-speed frames through different masks and these modulated frames are summed to a single measurement captured by a low-speed 2D sensor (dubbed optical encoder); following this, algorithms are employed to reconstruct the desired high-speed frames (dubbed software decoder) if needed. In this paper, we consider the reconstruction algorithm in video SCI, i.e., recovering a series of video frames from a compressed measurement. Specifically, we propose a Spatial-Temporal transFormer (STFormer) to exploit the correlation in both spatial and temporal domains. STFormer network is composed of a token generation block, a video reconstruction block, and these two blocks are connected by a series of STFormer blocks. Each STFormer block consists of a spatial self-attention branch, a temporal self-attention branch and the outputs of these two branches are integrated by a fusion network. Extensive results on both simulated and real data demonstrate the state-of-the-art performance of STFormer. The code and models are publicly available at https://github.com/ucaswangls/STFormer.git

연구 동기 및 목표

  • 기존의 수용장이 제한된 컨volution 네트워크(CNN)가 효과적으로 포착하지 못하는 영상 SCI 복원에서 장기적인 시간적 상관관계를 모델링하는 데 도전한다.
  • 입력 크기나 마스크가 변경될 경우 재학습이 필요로 하는 기존 딥러닝 모델의 유연성 부족 문제를 해결한다.
  • 다양한 압축률과 복잡한 운동 시나리오에서 높은 정밀도를 유지하는 빠르고 종단 간 복원 네트워크를 개발한다.
  • 노이즈와 복잡한 스펙트럼 교차 간섭으로 인해 여전히 도전적인 실생활 컬러 영상 SCI 데이터의 복원 품질을 향상시킨다.

제안 방법

  • STFormer 네트워크는 토큰 생성 블록, 영상 복원 블록, 공간-시간 자기주도 주의를 융합하는 네트워크를 통해 통합된 다수의 STFormer 블록으로 구성된다.
  • 각 STFormer 블록은 공간 윈도우와 시간적 시퀀스에 대해 별도로 국소 자기주도 주의를 적용하여 계산량을 줄이며 장거리 의존성을 효율적으로 모델링한다.
  • 공간 및 시간 주의 분 branches 는 분해되어 있으며, 학습 가능한 융합 네트워크를 통해 결합되어 공간적 및 시간적 일관성을 유지한다.
  • 아키텍처는 입력 크기와 마스크 패턴에 대해 매우 민첩하여, 이러한 요소가 변할 경우 재학습이 필요 없도록 설계되었다.
  • 예측된 프레임과 진짜 프레임 간의 픽셀 단위 오차를 최소화하기 위해 복원 손실을 사용하여 종단 간으로 모델을 훈련시킨다.
  • Bayer 필터를 통한 측정치를 활용하여 회색조 및 컬러 영상 SCI 모두를 지원하며, CACTI와 같은 실세계 시스템과도 호환된다.

실험 결과

연구 질문

  • RQ1Transformer 기반 아키텍처가 CNN 기반 방법을 능가할 정도로 영상 SCI 복원에서 장거리 공간-시간 상관관계를 효과적으로 모델링할 수 있는가?
  • RQ2제안된 STFormer 네트워크가 재학습 없이도 다양한 압축률과 입력 크기에서 높은 복원 품질을 유지할 수 있는가?
  • RQ3실세계 컬러 영상 SCI 데이터(복잡한 운동과 노이즈 존재)에서 기존 SOTA 방법과 비교해 STFormer의 성능은 어떠한가?
  • RQ4STFormer 아키텍처는 고 PSNR와 구조적 정밀도를 유지하면서도 빠른 추론 속도를 달성할 수 있는가?

주요 결과

  • STFormer는 복잡한 고속 시나리오(예: Duomino, Water Balloon)에서 PSNR가 30dB를 초과하는 SOTA 복원 성능를 달성하며, 이는 이전 방법들을 크게 능가한다.
  • 실제 컬러 영상 데이터(예: Hammer, Ball Rotate, Duomino)에서 STFormer는 GAP-TV, DeSCI, PnP-FastDVDnet보다 더 선명한 윤곽선과 더 적은 아티팩트를 생성하며, 특히 고속 운동 영역에서 뛰어난 성능을 보인다.
  • STFormer는 단 2.7초 내에 영상 프레임을 복원하며, DeSCI(3시간 이상)와 PnP-FastDVDnet(3.4분)에 비해 훨씬 빠른 추론 속도를 확보한다.
  • STFormer는 재학습 없이도 다양한 입력 크기와 마스크를 지원하는 최초의 종단 간 딥러닝 모델로서 실용적 구현 가능성을 크게 향상시켰다.
  • 압축률 B=10에서 B=50에 이르는 범위에서도 높은 성능를 유지하며, 고압축 상태에서도 명확한 운동 세부 정보가 유지된다.
  • 신규로 구축한 웨스트레이크 대학의 영상 SCI 시스템에서의 보조 결과는 STFormer의 강건성과 다양한 하드웨어 구성 및 마스크 패턴에 대한 일반화 능력을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.