Skip to main content
QUICK REVIEW

[论文解读] Learning Trajectory-Aware Transformer for Video Super-Resolution

Chengxu Liu, Huan Yang|arXiv (Cornell University)|Apr 8, 2022
Advanced Image Processing Techniques被引用 6
一句话总结

该论文提出 TTVSR,一种用于视频超分的轨迹感知 Transformer,通过学习视觉标记的时空轨迹来建模长程时间依赖性,从而在降低计算成本的同时提升性能。在具有挑战性的 REDS4 数据集上,TTVSR 相较于 BasicVSR 和 IconVSR 分别实现了 0.70 dB 和 0.45 dB 的 PSNR 提升,达到当前最先进水平。

ABSTRACT

Video super-resolution (VSR) aims to restore a sequence of high-resolution (HR) frames from their low-resolution (LR) counterparts. Although some progress has been made, there are grand challenges to effectively utilize temporal dependency in entire video sequences. Existing approaches usually align and aggregate video frames from limited adjacent frames (e.g., 5 or 7 frames), which prevents these approaches from satisfactory results. In this paper, we take one step further to enable effective spatio-temporal learning in videos. We propose a novel Trajectory-aware Transformer for Video Super-Resolution (TTVSR). In particular, we formulate video frames into several pre-aligned trajectories which consist of continuous visual tokens. For a query token, self-attention is only learned on relevant visual tokens along spatio-temporal trajectories. Compared with vanilla vision Transformers, such a design significantly reduces the computational cost and enables Transformers to model long-range features. We further propose a cross-scale feature tokenization module to overcome scale-changing problems that often occur in long-range videos. Experimental results demonstrate the superiority of the proposed TTVSR over state-of-the-art models, by extensive quantitative and qualitative evaluations in four widely-used video super-resolution benchmarks. Both code and pre-trained models can be downloaded at https://github.com/researchmm/TTVSR.

研究动机与目标

  • 解决现有视频超分方法仅依赖相邻帧、无法有效利用长程时间依赖性的问题。
  • 通过将自注意力限制在相关时空轨迹上,克服标准 Transformer 在视频任务中计算成本过高的问题。
  • 缓解长程视频序列中因物体尺度在帧间变化而引发的尺度变化问题。
  • 通过新颖的基于轨迹的注意力机制,实现在视频超分中有效的长程特征学习。
  • 通过将轨迹感知注意力与跨尺度特征标记化相结合,在标准基准上实现更优性能。

提出的方法

  • 将视频帧建模为视觉标记的预对齐轨迹,其中每条轨迹代表视觉元素在帧间的运动路径。
  • 引入可学习的位置映射,通过平均池化聚合像素运动,动态追踪并更新轨迹。
  • 仅将自注意力计算限制在同一条轨迹上的视觉标记之间,与标准视频 Transformer 相比,显著降低 FLOPs。
  • 提出跨尺度特征标记化(CFT)模块,从多个尺度层级(如 4、6、8)提取特征,以应对长程序列中的尺度变化。
  • 将轨迹生成与轨迹感知注意力整合到统一的 Transformer 架构中,实现高效且有效的长程建模。
  • 在 CFT 中采用多尺度特征聚合策略,即使物体在帧间尺寸变化,也能保留精细纹理。

实验结果

研究问题

  • RQ1轨迹感知注意力机制是否能在保持计算效率的同时,有效建模视频超分中的长程依赖性?
  • RQ2将自注意力限制在时空轨迹上,与完整视频注意力相比,在性能和效率方面有何差异?
  • RQ3跨尺度特征标记化在多大程度上可缓解长程视频序列中因尺度变化导致的性能退化?
  • RQ4在不产生收益递减的情况下,采样多少帧可用于长程建模为最优?
  • RQ5当运动复杂(如旋转)导致轨迹估计失败时,所提方法如何应对?

主要发现

  • TTVSR 在 REDS4 基准上达到 32.12 的 PSNR,相较 BasicVSR 提升 0.70 dB,相较 IconVSR 提升 0.45 dB。
  • 消融实验表明,轨迹感知注意力(TA)在与轨迹生成(TG)结合后,PSNR 从基础模型的 31.89 提升至 31.99,证明其在长程建模中的有效性。
  • 在跨尺度特征标记化(CFT)模块中使用三个尺度(4、6、8)可获得最佳性能(32.12 PSNR),而更大尺度(如 12)会导致纹理细节丢失,从而降低性能。
  • 随着帧采样间隔增大,性能在达到 45 帧(PSNR 为 32.01)后开始趋于平稳,之后增益减弱,表明 33 帧(间隔为 3)已足够实现完整序列建模。
  • 视觉对比显示,TTVSR 在远距离帧中能更好地恢复细节纹理(如图 1 中黄框区域),尤其在轨迹稳定时表现更优。
  • 在旋转等复杂运动场景下,轨迹估计可能失效,但 TTVSR 仍因强大的长程建模能力而优于其他最先进方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。