[论文解读] RSTT: Real-time Spatial Temporal Transformer for Space-Time Video Super-Resolution
RSTT 提出了一种用于时空视频超分的实时空间-时间变换器,将时间插值与空间超分统一为单一端到端的变换器架构,利用编码器构建的可重用多分辨率词典在解码器中查询,实现高帧率与高分辨率帧的同时合成。其在 720×576 分辨率下达到 26.2fps 的推理速度——比当前最先进方法快 80%——同时参数量减少 60%,且保持了具有竞争力的性能。
Space-time video super-resolution (STVSR) is the task of interpolating videos with both Low Frame Rate (LFR) and Low Resolution (LR) to produce High-Frame-Rate (HFR) and also High-Resolution (HR) counterparts. The existing methods based on Convolutional Neural Network~(CNN) succeed in achieving visually satisfied results while suffer from slow inference speed due to their heavy architectures. We propose to resolve this issue by using a spatial-temporal transformer that naturally incorporates the spatial and temporal super resolution modules into a single model. Unlike CNN-based methods, we do not explicitly use separated building blocks for temporal interpolations and spatial super-resolutions; instead, we only use a single end-to-end transformer architecture. Specifically, a reusable dictionary is built by encoders based on the input LFR and LR frames, which is then utilized in the decoder part to synthesize the HFR and HR frames. Compared with the state-of-the-art TMNet \cite{xu2021temporal}, our network is $60\%$ smaller (4.5M vs 12.3M parameters) and $80\%$ faster (26.2fps vs 14.3fps on $720 imes576$ frames) without sacrificing much performance. The source code is available at https://github.com/llmpass/RSTT.
研究动机与目标
- 为解决现有基于 CNN 的时空视频超分(STVSR)方法推理速度慢的问题,这些方法因架构庞大和冗余特征提取而受限。
- 将时间插值与空间超分统一为单一整体的变换器架构,避免显式地划分为两个子模块。
- 在计算资源严格受限的实际部署场景中,实现 STVSR 的实时推理。
- 在保持高视觉质量和标准基准测试性能的前提下,减少模型大小和参数量。
提出的方法
- RSTT 采用级联的 U-Net 风格架构,共享编码器-解码器模块,其中编码器从输入的低帧率和低分辨率帧中构建可重用的多分辨率词典。
- 解码器使用多头交叉注意力机制查询编码后的词典,实现高帧率与高分辨率输出帧的同时合成。
- 单一端到端的变换器架构取代了传统上分离的 VFI 和 VSR 网络两阶段设计,消除了冗余的特征提取。
- 采用固定查询进行插值,其设计允许通过重新表述查询,潜在扩展至任意时间戳的插值。
- 解码器中使用多头交叉注意力(MCA)进行特征融合,优于拼接和加法型融合策略。
- 提出三种变体——RSTT-S、RSTT-M 和 RSTT-L——通过调整深度与宽度,实现速度、精度与模型大小之间的平衡。
实验结果
研究问题
- RQ1统一的变换器架构能否在不显式分离任务的前提下,有效同时完成时间插值与空间超分?
- RQ2与两阶段基于 CNN 的 STVSR 方法相比,共享编码器与解码器的单一端到端变换器是否能实现更快的推理速度和更小的模型尺寸?
- RQ3变换器中的基于词典的注意力机制能否高效实现实时的高帧率与高分辨率视频帧重建?
- RQ4在 PSNR、SSIM、推理速度和参数量方面,所提出的 RSTT 模型相较于最先进方法的表现如何?
- RQ5多头交叉注意力是否优于拼接或加法等简单特征融合方法?
主要发现
- RSTT-S 在 720×576 分辨率下实现 26.2fps,超过标准电影帧率 24fps,适用于实时应用。
- RSTT-S 的推理速度比 STARNet 快 700%,比 Zooming SlowMo 快 75%,同时 PSNR 性能相当或更优。
- RSTT-L 仅使用 450 万个参数——比 TMNet 的 1230 万个参数减少 60%——同时在基准数据集上保持相似的 PSNR 与 SSIM 性能。
- RSTT-M 在 Vimeo-Fast 数据集上比 Zooming SlowMo 提升 0.2dB 的 PSNR,且参数量减少 50%,展现出更优的效率。
- 解码器中的多头交叉注意力(MCA)机制始终优于特征拼接与加法融合,PSNR 最高提升 0.3dB,SSIM 最高提升 0.006(在 Vimeo-Fast 上)。
- 采用更小重建模块的 RSTT-S-Recon(615 万个参数)与更大模块(608 万个参数)性能几乎完全一致,表明更大的模块并非必需,模型设计高效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。