Skip to main content
QUICK REVIEW

[論文レビュー] Towards Anytime Optical Flow Estimation with Event Cameras

Yaozu Ye, Hao Shi|arXiv (Cornell University)|Jul 11, 2023
Advanced Vision and Imaging被引用数 4
ひとこと要約

本稿では、イベントカメラを用いたいつでも光学フロー推定のための深層学習フレームワーク、EVA-Flowを提案する。統一されたボクセルグリッド表現と空間時間的モーションリファインメント(SMR)モジュールを導入することで、EVA-Flowは200Hzまで達する時間的に密な低遅延(5ms)光学フロー推定を可能にし、10Hzの低フレームレートの教師データで学習した場合でも、MVSEC、DSEC、および著者らが開発したEVA-FlowSetデータセットで最先端の精度と優れた一般化性能を達成する。

ABSTRACT

Event cameras respond to changes in log-brightness at the millisecond level, making them ideal for optical flow estimation. However, existing datasets from event cameras provide only low frame rate ground truth for optical flow, limiting the research potential of event-driven optical flow. To address this challenge, we introduce a low-latency event representation, Unified Voxel Grid, and propose EVA-Flow, an EVent-based Anytime Flow estimation network to produce high-frame-rate event optical flow with only low-frame-rate optical flow ground truth for supervision. Furthermore, we propose the Rectified Flow Warp Loss (RFWL) for the unsupervised assessment of intermediate optical flow. A comprehensive variety of experiments on MVSEC, DESC, and our EVA-FlowSet demonstrates that EVA-Flow achieves competitive performance, super-low-latency (5ms), time-dense motion estimation (200Hz), and strong generalization. Our code will be available at https://github.com/Yaozhuwa/EVA-Flow.

研究の動機と目的

  • 既存のイベントベース光学フロー手法が、低フレームレートの教師データ(例:10Hz や 20Hz)に制限されることによる、高時間分解能での動き推定の制限を解消すること。
  • 低周波数のデータセットからの教師信号にもかかわらず、任意の時間間隔で出力される密な動き場を生成できる「いつでも光学フロー推定」を可能にすること。
  • イベントカメラの高時間分解能および低遅延特性を活かしたネットワークアーキテクチャを設計し、リアルタイムで時間的に密な動き推定を実現すること。
  • 教師なしの評価指標、補正されたフローワープ損失(RFWL)を導入し、教師データが存在しない状況でも中間の光学フロー予測を検証できること。

提案手法

  • すべての時間ボックスで一貫したイベント符号化を保証する統一されたボクセルグリッド表現を提案し、標準的なボクセルグリッドと比較して特徴品質を向上させる。
  • 時間的に密な光学フローを逐次的に推定し、時間ボックス間で動き推定を繰り返し精錬するスタック型の空間時間的モーションリファインメント(SMR)モジュールを導入する。
  • SMRモジュール内での時間的に密な特徴ワープを採用し、中間のフロー予測に対する暗黙の教師信号を提供することで、空間的・時間的整合性を高め、精度を向上させる。
  • 固定時間幅のボックスごとに逐次処理を行うインフェレンス戦略を採用し、予測ボックス数を調整することで柔軟に出力フレームレートを制御できる。
  • 教師データが利用できない状況でも、中間のフロー予測を効果的に評価できるよう、補正されたフローワープ損失(RFWL)を教師なし指標として活用する。
  • DSEC(10Hz)などの低フレームレートデータセットでモデルを学習するが、予測ボックス数を増やすことで、200Hzまでの高フレームレートでの推論を可能にする。

実験結果

リサーチクエスチョン

  • RQ1イベントベース光学フローネットワークは、学習データの教師データのフレームレートを超えて、時間的に密な動き推定を達成できるか?
  • RQ2時間的に密な特徴ワープからの暗黙の教師信号は、イベントベースネットワークの光学フロー精度をどのように向上させるか?
  • RQ3標準的なボクセルグリッドと比較して、統一されたボクセルグリッド表現は光学フロー推定性能にどのような影響を及えるか?
  • RQ4教師データが存在しない状況でも、RFWLのような教師なし評価指標が中間の光学フロー予測を効果的に検証できるか?
  • RQ5予測ボックス数の増加は、いつでも光学フロー推定における推論遅延、精度、一般化性能にどのような影響を及えるか?

主な発見

  • DSECデータセットにおいて21個のボックスを使用した200Hzでの推論で、エンドポイント誤差(EPE)が0.877に達し、超高周波数での高い精度を実現した。
  • モデルはわずか5msの遅延と、1枚のGPUで9.2msの推論速度を達成し、リアルタイムでのいつでも光学フロー推定を実現した。
  • 統一されたボクセルグリッドは、すべてのボックスで一貫したイベント表現を実現し、標準的なボクセルグリッドと比較してEPEを7.3%低減した。
  • ボックス数を6から21に増やすと、EPEは0.955から0.877に低下し、時間分解能が向上することで精度が向上したが、31ボックスではイベントの希釈が原因でわずかに劣化した。
  • 補正されたフローワープ損失(RFWL)により、教師データが存在しない状況でも中間のフロー予測の内部整合性と動きの精錬が効果的に検証可能となった。
  • モデルは複数のデータセット(MVSEC、DSEC、および新たに導入されたEVA-FlowSet)にわたって優れた一般化性能を示し、異なるイベントレートやシーンの動的変化に対しても強く、競争力のある性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。