Skip to main content
QUICK REVIEW

[論文レビュー] Spatio-Temporal Recurrent Networks for Event-Based Optical Flow Estimation

Ziluo Ding, Rui Zhao|arXiv (Cornell University)|Sep 10, 2021
Advanced Memory and Neural Computing被引用数 9
ひとこと要約

本稿では、イベントストリームから動的空間時間特徴を抽出するために畳み込みゲート付き再帰ユニット(ConvGRU)を活用する、空間時間的再帰的エンコーダデコーダーネットワークであるSTE-FlowNetを提案する。さらに、信号強化を目的とした新しい時間的分布に基づく入力表現を導入している。本手法は、再帰的アーキテクチャ内での相関層と反復的残差精錬の統合を効果的に行うことで、MVSECデータセット上で、特に高速な状況において、既存の最先端手法をすべて上回る性能を発揮する。

ABSTRACT

Event camera has offered promising alternative for visual perception, especially in high speed and high dynamic range scenes. Recently, many deep learning methods have shown great success in providing promising solutions to many event-based problems, such as optical flow estimation. However, existing deep learning methods did not address the importance of temporal information well from the perspective of architecture design and cannot effectively extract spatio-temporal features. Another line of research that utilizes Spiking Neural Network suffers from training issues for deeper architecture.To address these points, a novel input representation is proposed that captures the events' temporal distribution for signal enhancement. Moreover, we introduce a spatio-temporal recurrent encoding-decoding neural network architecture for event-based optical flow estimation, which utilizes Convolutional Gated Recurrent Units to extract feature maps from a series of event images. Besides, our architecture allows some traditional frame-based core modules, such as correlation layer and iterative residual refine scheme, to be incorporated. The network is end-to-end trained with self-supervised learning on the Multi-Vehicle Stereo Event Camera dataset. We have shown that it outperforms all the existing state-of-the-art methods by a large margin. The code link is https://github.com/ruizhao26/STE-FlowNet.

研究の動機と目的

  • 既存のディープラーニング手法が、アーキテクチャ設計の欠陥により、イベントデータからの時間的ダイナミクスを捉えることのできないという制限に対処すること。
  • イベントの時間的分布をモデル化することで、高速かつノイズの多い状況におけるイベント信号の品質を向上させること。
  • フレームベースのコンponents(例:相関層や反復的残差精錬)をイベントベース光学フロー推定に統合できること。
  • 再帰的処理を活用した、エンドツーエンドで学習可能な自己教師ありフレームワークを構築すること。
  • 多様な屋内および屋外のイベントベースの状況において、優れた一般化性能を示すこと。

提案手法

  • 高速な運動期間における信号品質の向上を目的として、イベントの時間的分布に基づいてイベントを集積する、新しい入力表現を提案する。
  • ConvGRUユニットを用いて、時間的に順序立ててイベント画像を処理する空間時間的再帰的エンコーダデコーダーネットワーク(STE-FlowNet)を設計する。
  • イベント画像を時間順にフレーム単位で処理し、中間の光学フロー予測がその後続の推定に影響を与えるようにする。
  • 入力の結合ではなく、逐次的なイベント画像処理により、従来イベントベースのネットワークでは適用できなかった相関層を統合する。
  • 中間のフローエstimatesを用いて、逐次的に光学フロー予測を精錬する反復的残差精錬(IRR)方式を採用する。
  • 時間ステップに跨る複数の途中監督信号を用いることで、学習の安定性と性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1再帰的アーキテクチャは、イベントベース光学フロー推定における空間時間的依存関係を効果的にモデル化できるか?
  • RQ2時間的分布に基づく入力表現は、高速な状況における信号品質とフローエstimatationの正確性を向上させるか?
  • RQ3従来のフレームベースコンponents(例:相関層)は、イベントベース光学フローネットワークに成功裏に適応可能か?
  • RQ4反復的残差精錬は、イベントベースの設定において、どの程度フローエstimatationを向上させるか?
  • RQ5時間ステップに跨る途中監督の統合は、モデル性能にどのような影響を与えるか?

主な発見

  • STE-FlowNetは、MVSECデータセット上で、特にdt=4のケースにおいて、既存のすべての最先端手法を上回り、多様なシーンにわたる優れた一般化性能を示している。
  • 提案された時間的分布に基づく入力表現は、単純なイベントカウントや時間表面表現と比較して、信号品質とフローエstimatationの正確性を顕著に向上させている。
  • アブレーションスタディにより、ConvGRU、相関層、反復的残差精錬方式がそれぞれ性能向上に有意義に寄与しており、フルモデルが最良の結果を達成していることが確認された。
  • イベントベースのネットワークに相関層を統合することは効果的で有益であり、直接的なフロー結合と比較して性能向上が示された。
  • 時間ステップに跨る複数の途中損失(MIL)は、再帰的監督の価値を裏付ける形で、モデル性能をさらに向上させた。
  • 定性的な結果から、STE-FlowNetは、特にスパarsな状況や動的なシーンにおいて、Spike-FlowNetと比較してエッジ領域でより正確なフローを予測し、真値とよりよく一致していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。