Skip to main content
QUICK REVIEW

[論文レビュー] Memory-Efficient Network for Large-scale Video Compressive Sensing

Ziheng Cheng, Bo Chen|arXiv (Cornell University)|Mar 4, 2021
Sparse and Compressive Sensing Techniques参考文献 51被引用数 8
ひとこと要約

本論文は、大規模な動画圧縮センシング再構成のための、メモリ効率が良く、エンドツーエンドで逆転可能な3次元畳み込みニューラルネットワークであるRevSCI-netを提案する。マルチグループ逆転可能3次元畳み込みを活用することで、高解像度動画(例:512×512×50)のトレーニングと推論を、顕著に低いメモリ使用量で実現可能となり、50の圧縮レートで最先端の結果を達成した。実世界のSCIカメラデータに対しても同様の性能を示し、このような大規模問題を処理できる最初のディーブラーニングモデルである。

ABSTRACT

Video snapshot compressive imaging (SCI) captures a sequence of video frames in a single shot using a 2D detector. The underlying principle is that during one exposure time, different masks are imposed on the high-speed scene to form a compressed measurement. With the knowledge of masks, optimization algorithms or deep learning methods are employed to reconstruct the desired high-speed video frames from this snapshot measurement. Unfortunately, though these methods can achieve decent results, the long running time of optimization algorithms or huge training memory occupation of deep networks still preclude them in practical applications. In this paper, we develop a memory-efficient network for large-scale video SCI based on multi-group reversible 3D convolutional neural networks. In addition to the basic model for the grayscale SCI system, we take one step further to combine demosaicing and SCI reconstruction to directly recover color video from Bayer measurements. Extensive results on both simulation and real data captured by SCI cameras demonstrate that our proposed model outperforms previous state-of-the-art with less memory and thus can be used in large-scale problems. The code is at https://github.com/BoChenGroup/RevSCI-net.

研究の動機と目的

  • 大規模な動画圧縮センシング(SCI)におけるディープラーニングベースの再構成の高コストなメモリと計算量を解決すること。
  • 限られたGPUメモリ環境下でも、高解像度の動画データ(例:FHD以上)に対してエンドツーエンドのトレーニングと推論を可能にすること。
  • デモザイキングとSCI再構成を1つのエンドツーエンドネットワークに統合し、ベイラー・フィルター付き測定値からRGB動画を直接回復すること。
  • 大規模なSCI問題において、GPUメモリ消費量を最小限に抑えながら、最先端の再構成品質と高速な推論を達成すること。

提案手法

  • 本手法は、逆可逆性を有する残差ブロックを用いることで、トレーニング中に活性化を保存しない逆転可能3次元畳み込みニューラルネットワーク(RevSCI-net)を採用する。
  • マルチグループ逆転可能3次元畳み込みを用いることで、パラメータ共有と逆可逆変換により、特徴表現を強化しながらも、メモリ効率を維持する。
  • ネットワークは、1ショットの圧縮測定値から3次元動画ボリューム(空間時間的データ)を再構成するようにエンドツーエンドでトレーニングされる。
  • 独創的なアーキテクチャにより、デモザイキングとSCI再構成を1つのネットワークに統合し、ベイラー・フィルター付きの生データから直接RGB動画を回復可能にする。
  • 逆転可能設計により、バックプロパゲーション中に活性化を保存しないため、トレーニング時のメモリフットプリントが著しく削減される。
  • 本モデルは、シミュレーテッドおよび実世界のSCIデータセット、特に物理的SCIカメラで撮影された大規模データ(512×512×50)を用いて評価された。

実験結果

リサーチクエスチョン

  • RQ1ディープラーニングベースの再構成手法は、大規模な圧縮測定値から高品質な動画再構成を達成しつつ、メモリ効率を保てるか?
  • RQ21つのエンドツーエンドネットワークにデモザイキングとSCI再構成を統合することで、色付き動画再構成性能にどのような影響を与えるか?
  • RQ3逆転可能3次元CNNアーキテクチャは、大規模な動画SCIにおいて、再構成品質を損なわずに、どの程度のメモリ消費量を削減できるか?
  • RQ4本手法は、実世界の高解像度SCIデータにおいて、既存の最先端手法を再構成品質と推論速度の両面で上回れるか?
  • RQ51つのGPUを用いて、FHDレベルの動画(1920×1080×24)のトレーニングとデプロイを、メモリ効率の良いアーキテクチャにより実現可能か?

主な発見

  • RevSCI-netは、512×512×50の実データセットにおいてPSNR 33.84、SSIM 0.956を達成し、品質とメモリ効率の両面でBIRNATおよびDeSCIを上回った。
  • モデルは512×512×50動画をわずか1350 MBのメモリフットプリントで再構成可能であり、BIRNATの48000 MBと比べ顕著に低い。これにより、1枚の48GB GPUでトレーニングが可能になった。
  • 実データ(例:DominoおよびWater Balloon)において、RevSCI-netはDeSCI(過剰に平滑化)やGAP-TV(ノイジー)と比較して、より鋭い運動の輪郭と明確なディテールを再構成した。
  • 1920×1080×24動画の再構成時間は12.46秒であり、DeSCI(3.5時間以上)と比べて著しく高速で、小規模解像度では数秒で完了した。
  • RevSCI-netは、逆転可能アーキテクチャのおかげで、FHDレベルのSCIデータ(1920×1080×24)を1つのGPUで処理できる最初のエンドツーエンドディープラーニングモデルである。
  • アブレーションスタディにより、逆転可能ブロックの数を増やすことで再構成品質が向上し、グループ数を増やすことで特徴レベルの変換が強化される一方、活性化のメモリ消費量は増加しなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。