Skip to main content
QUICK REVIEW

[論文レビュー] Spatial-Temporal Transformer for Video Snapshot Compressive Imaging

Lishun Wang, Miao Cao|arXiv (Cornell University)|Sep 4, 2022
Sparse and Compressive Sensing Techniques被引用数 10
ひとこと要約

本稿では、空間的および時間的領域における因子化自己注意を活用して長距離相関をモデル化する、動画スナップショット圧縮イメージング(SCI)再構成のための空間的時間的Transformerネットワーク、STFormerを提案する。30 dBを超えるPSNRを実現し、複雑な高速シーンでも最先端の性能を達成しており、再訓練を必要とせず、変動するマスクや入力サイズに対応できる。また、わずか2.7秒で高速かつエンド・ツー・エンドの推論が可能である。

ABSTRACT

Video snapshot compressive imaging (SCI) captures multiple sequential video frames by a single measurement using the idea of computational imaging. The underlying principle is to modulate high-speed frames through different masks and these modulated frames are summed to a single measurement captured by a low-speed 2D sensor (dubbed optical encoder); following this, algorithms are employed to reconstruct the desired high-speed frames (dubbed software decoder) if needed. In this paper, we consider the reconstruction algorithm in video SCI, i.e., recovering a series of video frames from a compressed measurement. Specifically, we propose a Spatial-Temporal transFormer (STFormer) to exploit the correlation in both spatial and temporal domains. STFormer network is composed of a token generation block, a video reconstruction block, and these two blocks are connected by a series of STFormer blocks. Each STFormer block consists of a spatial self-attention branch, a temporal self-attention branch and the outputs of these two branches are integrated by a fusion network. Extensive results on both simulated and real data demonstrate the state-of-the-art performance of STFormer. The code and models are publicly available at https://github.com/ucaswangls/STFormer.git

研究の動機と目的

  • 従来の畳み込みニューラルネットワーク(CNN)が受容 field が限られているため、動画SCI再構成における長期的時間的相関を効果的に捉えることが難しいという課題に対処すること。
  • 入力サイズやマスクが変化する際に再訓練が必要な既存のディープラーニングモデルの不柔軟性を克服すること。
  • 多様な圧縮レートや複雑な運動シーンにおいても高い忠実度を維持する、高速でエンド・ツー・エンドの再構成ネットワークを開発すること。
  • ノイズや複雑なスペクトルクロストークの影響により、依然として挑戦的な実際のカラー動画SCIデータにおける再構成品質の向上を図ること。

提案手法

  • STFormerネットワークは、トーケン生成ブロック、動画再構成ブロック、空間的および時間的自己注意を統合する融合ネットワークを備えた複数のSTFormerブロックから構成される。
  • 各STFormerブロックは、空間ウィンドウと時間的シーケンスの両方に対して別々に局所的自己注意を適用することで、計算量を削減しつつ長距離依存関係を効率的にモデル化する。
  • 空間的および時間的注意ブランチは因子化され、学習可能な融合ネットワークを通じて組み合わされ、空間的および時間的整合性を保持する。
  • アーキテクチャは入力サイズやマスクパターンに対して柔軟に設計されており、これらが変化しても再訓練の必要がない。
  • 予測フレームと真値フレームのピクセル単位の誤差を最小化する再構成損失を用いて、エンド・ツー・エンドでモデルを訓練する。
  • Bayerフィルタード測定値を用いてグレースケールおよびカラー動画SCIの両方に対応可能であり、CACTIのような実世界のシステムとも互換性がある。

実験結果

リサーチクエスチョン

  • RQ1Transformerベースのアーキテクチャは、CNNベースの手法を上回る性能で、動画SCI再構成における長距離空間的時間的相関を効果的にモデル化できるか?
  • RQ2提案されたSTFormerネットワークは、再訓練を伴わずに、変動する圧縮レートや入力サイズにおいても高い再構成品質を維持できるか?
  • RQ3ノイズや複雑な運動を伴う実世界のカラー動画SCIデータにおいて、STFormerは既存のSOTA手法と比較してどのように性能を発揮するか?
  • RQ4STFormerアーキテクチャは、高いPSNRと構造的忠実度を維持しつつ、高速な推論速度を達成できるか?

主な発見

  • STFormerは、ドミノやウォーターバルーンのような複雑な高速シーンにおいて、30 dBを超えるPSNRを達成し、先行手法を著しく上回る最先端の再構成性能を実現した。
  • 実際のカラー動画データ(例:ハンマー、ボール回転、ドミノ)において、GAP-TV、DeSCI、PnP-FastDVDnetと比較して、特に高運動領域で縁が明瞭で、アーチファクトも少ない再構成を実現した。
  • フレームの再構成にわずか2.7秒で完了し、DeSCI(3時間以上)やPnP-FastDVDnet(3.4分)を大きく上回る推論速度を示した。これは、優れた推論速度を実現していることを示している。
  • STFormerは、再訓練なしに変動する入力サイズやマスクをサポートできる、動画SCIにおける最初のエンド・ツー・エンドディープラーニングモデルである。これは、実用的展開性を大幅に向上させる。
  • 圧縮レートB=10からB=50の範囲で高い性能を維持しており、高圧縮でも明確な運動詳細が保持されていることが確認された。
  • 新しく西湖大学が構築した動画SCIシステムにおける補足結果から、STFormerのハードウェア構成やマスクパターンの違いに対しても、強靭性と一般化性能が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。