[논문 리뷰] RSTT: Real-time Spatial Temporal Transformer for Space-Time Video Super-Resolution
RSTT는 공간-시간 비디오 초해상도 분석을 위한 실시간 공간-시간 트랜스포머를 제안하며, 시간 보간과 공간 초해상도를 하나의 엔드 투 엔드 트랜스포머 아키텍처로 통합한다. 이는 인코더가 생성한 재사용 가능한 다중 해상도 사전을 디코더에서 질의하여 고프레임레트 및 고해상도 프레임을 동시에 합성한다. 720×576 프레임에서 26.2fps를 달성하여 최신 기술 대비 80% 빠르며, 파라미터 수는 60% 줄였고 경쟁적인 성능을 유지한다.
Space-time video super-resolution (STVSR) is the task of interpolating videos with both Low Frame Rate (LFR) and Low Resolution (LR) to produce High-Frame-Rate (HFR) and also High-Resolution (HR) counterparts. The existing methods based on Convolutional Neural Network~(CNN) succeed in achieving visually satisfied results while suffer from slow inference speed due to their heavy architectures. We propose to resolve this issue by using a spatial-temporal transformer that naturally incorporates the spatial and temporal super resolution modules into a single model. Unlike CNN-based methods, we do not explicitly use separated building blocks for temporal interpolations and spatial super-resolutions; instead, we only use a single end-to-end transformer architecture. Specifically, a reusable dictionary is built by encoders based on the input LFR and LR frames, which is then utilized in the decoder part to synthesize the HFR and HR frames. Compared with the state-of-the-art TMNet \cite{xu2021temporal}, our network is $60\%$ smaller (4.5M vs 12.3M parameters) and $80\%$ faster (26.2fps vs 14.3fps on $720 imes576$ frames) without sacrificing much performance. The source code is available at https://github.com/llmpass/RSTT.
연구 동기 및 목표
- 기존의 CNN 기반 공간-시간 비디오 초해상도(STVSR) 방법이 과도한 아키텍처와 중복된 특징 추출으로 인해 느린 추론 속도를 보이는 문제를 해결하기 위해.
- 시간 보간과 공간 초해상도를 명시적인 분리 없이 하나의 통합 트랜스포머 아키텍처로 통합하기 위해.
- 엄격한 계산 자원 제약 조건이 있는 실질적 배포 환경에서 STVSR의 실시간 추론을 가능하게 하기 위해.
- 표준 벤치마크에서 높은 시각적 품질과 성능을 유지하면서도 모델 크기와 파라미터 수를 줄이기 위해.
제안 방법
- RSTT는 공유된 인코더-디코더 블록을 가진 캐스케이드 U-Net 스타일 아키텍처를 사용하며, 인코더가 입력된 저프레임레트 및 저해상도 프레임에서 재사용 가능한 다중 해상도 사전을 구축한다.
- 디코더는 다중 헤드 크로스 어텐션을 사용해 인코딩된 사전을 질의하여 고프레임레트 및 고해상도 출력 프레임을 동시에 합성한다.
- 기존의 별도의 VFI 및 VSR 네트워크로 구성된 이중 단계 설계를 대체하기 위해 단일 엔드 투 엔드 트랜스포머 아키텍처를 사용하여 중복된 특징 추출을 제거한다.
- 보간을 위한 고정된 질의를 사용하며, 재구성된 질의를 통해 임의의 타임스탬프 보간으로의 확장이 가능하도록 설계되어 있다.
- 디코더에서 특징 융합을 위해 다중 헤드 크로스 어텐션(MCA)을 사용하여, 연결 또는 덧셈 기반 융합 전략보다 우수한 성능을 낸다.
- 깊이와 너비를 조절한 세 가지 변종—RSTT-S, RSTT-M, RSTT-L—을 도입하여 속도, 정확도, 모델 크기 간의 균형을 맞춘다.
실험 결과
연구 질문
- RQ1명시적인 작업 분리 없이도 통합된 트랜스포머 아키텍처가 시간 보간과 공간 초해상도를 효과적으로 수행할 수 있는가?
- RQ2공유된 인코더와 디코더를 가진 단일 엔드 투 엔드 트랜스포머 아키텍처가 이중 단계 CNN 기반 STVSR 방법 대비 더 빠른 추론 속도와 더 작은 모델 크기를 달성할 수 있는가?
- RQ3트랜스포머 내의 사전 기반 어텐션 메커니즘이 실시간으로 고프레임레트 및 고해상도 비디오 프레임을 효율적으로 재구성할 수 있는가?
- RQ4제안된 RSTT 모델의 성능은 PSNR, SSIM, 추론 속도, 파라미터 수 측면에서 최신 기술 대비 어떻게 비교되는가?
- RQ5디코더에서 다중 헤드 크로스 어텐션은 연결 또는 덧셈과 같은 간단한 특징 융합 방법보다 우수한 성능을 낼 수 있는가?
주요 결과
- RSTT-S는 720×576 프레임에서 26.2fps를 달성하여 영화 표준 프레임 레이트인 24fps를 초월하여 실시간 응용에 적합하다.
- RSTT-S는 STARNet 대비 700% 빠르고 Zooming SlowMo 대비 75% 더 빠르며, PSNR 성능은 유사하거나 더 우수하다.
- RSTT-L는 450만 개의 파라미터를 사용하며, TMNet의 1230만 개 대비 60% 줄였다. 그러나 벤치마크 데이터셋에서 유사한 PSNR 및 SSIM 성능을 유지한다.
- RSTT-M는 Vimeo-Fast에서 Zooming SlowMo 대비 0.2dB 높은 PSNR 성능을 보이며, 파라미터 수는 50% 줄였다. 이는 뛰어난 효율성을 보여준다.
- 디코더 내 다중 헤드 크로스 어텐션(MCA) 메커니즘은 특징 연결 및 덧셈 기반 융합 방식보다 항상 뛰어나며, Vimeo-Fast에서 PSNR 최대 0.3dB 향상 및 SSIM 최대 0.006 향상된 성과를 기록했다.
- 더 작은 재구성 블록을 가진 RSTT-S-Recon은 더 큰 블록(615만 vs 608만 파라미터)과 거의 동일한 성능을 보이며, 더 큰 블록이 불필요하고 모델이 효율적으로 설계되어 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.