Skip to main content
QUICK REVIEW

[論文レビュー] Learning Trajectory-Aware Transformer for Video Super-Resolution

Chengxu Liu, Huan Yang|arXiv (Cornell University)|Apr 8, 2022
Advanced Image Processing Techniques被引用数 6
ひとこと要約

本稿では、視覚的トークンの空間時間的軌道を学習することで長時間的な依存関係をモデル化し、計算コストを低減しながら性能を向上させる、トラジェクトリーアウェアなTransformer、TTVSRを提案する。本手法は、挑戦的なREDs4データセットにおいて、BasicVSRおよびIconVSRに対してそれぞれ0.70 dBおよび0.45 dBのPSNR向上を達成し、最先端の性能を実現した。

ABSTRACT

Video super-resolution (VSR) aims to restore a sequence of high-resolution (HR) frames from their low-resolution (LR) counterparts. Although some progress has been made, there are grand challenges to effectively utilize temporal dependency in entire video sequences. Existing approaches usually align and aggregate video frames from limited adjacent frames (e.g., 5 or 7 frames), which prevents these approaches from satisfactory results. In this paper, we take one step further to enable effective spatio-temporal learning in videos. We propose a novel Trajectory-aware Transformer for Video Super-Resolution (TTVSR). In particular, we formulate video frames into several pre-aligned trajectories which consist of continuous visual tokens. For a query token, self-attention is only learned on relevant visual tokens along spatio-temporal trajectories. Compared with vanilla vision Transformers, such a design significantly reduces the computational cost and enables Transformers to model long-range features. We further propose a cross-scale feature tokenization module to overcome scale-changing problems that often occur in long-range videos. Experimental results demonstrate the superiority of the proposed TTVSR over state-of-the-art models, by extensive quantitative and qualitative evaluations in four widely-used video super-resolution benchmarks. Both code and pre-trained models can be downloaded at https://github.com/researchmm/TTVSR.

研究の動機と目的

  • 従来の動画超解像手法が隣接フレームのみに依存しており、長時間的な依存関係を十分に活用できないという限界を解決する。
  • 標準的なTransformerが動画処理において高い計算コストを要することを克服し、自己注意機構を関連する空間時間的軌道に制限することで実現する。
  • オブジェクトのスケールがフレーム間で変化する長時間の動画シーケンスにおけるスケール変化問題を緩和する。
  • 新しいトラジェクトリーベースの注意機構を用いて、動画超解像における効果的な長時間特徴学習を実現する。
  • トラジェクトリーアウェアな注意機構とクロススケール特徴トークン化を組み合わせることで、標準ベンチマークで優れた性能を達成する。

提案手法

  • 各フレームを、視覚的要素がフレーム間を移動するパス(軌道)として事前に整列された視覚的トークンの集合として定式化する。
  • 平均プーリングを用いてピクセルの動きを集約することで、動的に軌道を追跡・更新できる学習可能な位置マップを導入する。
  • 自己注意計算を、同じ軌道に沿った視覚的トークンに限定することで、標準的な動画Transformerに比べてFLOPsを著しく削減する。
  • 複数のスケールレベル(例:4, 6, 8)からの特徴を抽出するクロススケール特徴トークン化(CFT)モジュールを提案し、長時間シーケンスにおけるスケール変動に対処する。
  • 軌道生成とトラジェクトリーアウェアな注意機構を統合した一貫性のあるTransformerアーキテクチャを構築し、効率的かつ効果的な長時間モデリングを実現する。
  • CFTにおけるマルチスケール特徴集約戦略を用いることで、オブジェクトのサイズ変化に対しても微細なテクスチャを保持する。

実験結果

リサーチクエスチョン

  • RQ1トラジェクトリーアウェアな注意機構は、計算効率を維持したまま、動画超解像における長時間依存関係を効果的にモデル化できるか?
  • RQ2自己注意を空間時間的軌道に制限することと、完全な動画注意機構とを比較した場合、性能と効率の面でどのように異なるか?
  • RQ3クロススケール特徴トークン化は、長時間シーケンスにおけるスケール変化に起因する性能低下をどの程度緩和できるか?
  • RQ4利益の減少を示さない範囲で、長時間モデリングに最適なフレーム数のサンプリング間隔は何か?
  • RQ5回転などの複雑な運動では、軌道推定が失敗する可能性があるが、本手法はそのような状況でも効果的に動作するか?

主な発見

  • TTVSRはREDs4ベンチマークで32.12のPSNRを達成し、BasicVSRに対して0.70 dB、IconVSRに対して0.45 dBのPSNR向上を示した。
  • アブレーションスタディの結果、トラジェクトリーアウェアな注意(TA)を軌道生成(TG)と組み合わせることで、ベースモデルの31.89から31.99にPSNRが向上し、長時間モデリングにおける有効性が示された。
  • クロススケール特徴トークン化(CFT)モジュールで3つのスケール(4, 6, 8)を用いることで最良の性能(32.12 PSNR)が得られたが、より大きなスケール(例:12)を用いるとうまくいかず、テクスチャの詳細が損なわれた。
  • フレームのサンプリング間隔が45フレームまで増加するにつれて性能が向上(32.01 PSNR)したが、以降は上昇の余地が小さくなり、33フレーム(間隔3)で十分なシーケンスモデリングが可能であることが示された。
  • 可視化比較では、TTVSRが遠く離れたフレーム(図1の黄枠で示された領域など)において、より細かいテクスチャを回復できており、特に軌道が安定している場合に顕著であった。
  • 回転の影響で軌道推定が失敗する場合の失敗事例は観察されたが、TTVSRは依然として他の最先端手法を上回る性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。