Skip to main content
QUICK REVIEW

[論文レビュー] FastFlowNet: A Lightweight Network for Fast Optical Flow Estimation

Lingtong Kong, Chunhua Shen|arXiv (Cornell University)|Mar 8, 2021
Advanced Vision and Imaging参考文献 31被引用数 5
ひとこと要約

FastFlowNet は、粗くから細かくまでのフレームワークを採用し、3つの主な革新を実現する軽量でリアルタイムなオプティカルフロー網を提案する:特徴抽出のためのヘッド強化プーリングピラミッド(HEPP)、コン pact なコストボリューム構築のためのセンター密度拡張相関(CDDC)層、高速なフローエstimatio ンのためのシャッフルブロックデコーダー(SBD)。1.37Mパラメータと12.2 GFLOPs のわずかな計算量で最先端の精度を達成し、GTX 1080Ti では90 FPS、組み込み型のJetson TX2 では5.7 FPS で動作する。これは同等のモデルの計算量の1/10に過ぎない。

ABSTRACT

Dense optical flow estimation plays a key role in many robotic vision tasks. In the past few years, with the advent of deep learning, we have witnessed great progress in optical flow estimation. However, current networks often consist of a large number of parameters and require heavy computation costs, largely hindering its application on low power-consumption devices such as mobile phones. In this paper, we tackle this challenge and design a lightweight model for fast and accurate optical flow prediction. Our proposed FastFlowNet follows the widely-used coarse-to-fine paradigm with following innovations. First, a new head enhanced pooling pyramid (HEPP) feature extractor is employed to intensify high-resolution pyramid features while reducing parameters. Second, we introduce a new center dense dilated correlation (CDDC) layer for constructing compact cost volume that can keep large search radius with reduced computation burden. Third, an efficient shuffle block decoder (SBD) is implanted into each pyramid level to accelerate flow estimation with marginal drops in accuracy. Experiments on both synthetic Sintel data and real-world KITTI datasets demonstrate the effectiveness of the proposed approach, which needs only 1/10 computation of comparable networks to achieve on par accuracy. In particular, FastFlowNet only contains 1.37M parameters; and can execute at 90 FPS (with a single GTX 1080Ti) or 5.7 FPS (embedded Jetson TX2 GPU) on a pair of Sintel images of resolution 1024x436.

研究の動機と目的

  • 既存のディープラーニングベースのオプティカルフロー網が直面する高い計算コストと大きなモデルサイズの問題に対処し、モバイルおよび組み込みデバイスへのデプロイを困難にしている要因を解消すること。
  • モバイル端末や無人航空機(UAV)などの低消費電力プラットフォーム上で、リアルタイムかつ高精度なオプティカルフロー推定を実現すること。
  • 特徴抽出、コストボリューム構築、フロー復元の各段階を再設計し、精度を損なわずに効率性を高めること。
  • 標準ベンチマーク上で性能を維持または向上させつつ、FLOPs とモデルサイズを大幅に削減すること。

提案手法

  • 高レベルの畳み込み層と低レベルのパrameter-free プーリングを組み合わせることで、パラメータと計算量を削減しながら高分解能特徴を保持するヘッド強化プーリングピラミッド(HEPP)を導入する。
  • 特徴を拡張された中心集中的なパターンでサンプリングすることで、大きな有効受容野を実現しつつ、コン pact なコストボリュームを構築するセンター密度拡張相関(CDDC)層を提案する。これにより、計算量を削減しながらも広い探索半径を維持できる。
  • グループ化された深度分離畳み込みを用いたシャッフルブロックデコーダー(SBD)を採用し、パラメータとFLOPs を圧縮しながら精度の低下を最小限に抑える。
  • 各ピラミッドレベルで残留フローを推定する粗くから細かくまでの残差学習フレームワークを採用することで、大規模な変位の高精度推定を実現しつつ、複雑さを低減する。
  • 合成データおよび実世界データセットでの微調整のため、適応的重み付け(Sintel では q = 0.4、KITTI では q = 0.2)を備えた頑健な損失関数と、600kイテレーションにわたる学習率スケジュールを適用する。
  • デスクトップGPUと組み込みGPUの両方で、Sintel(合成)およびKITTI(実世界)ベンチマークを評価し、精度、FLOPs、推論時間を測定する。

実験結果

リサーチクエスチョン

  • RQ1既存手法と比較して、大幅にFLOPsとモデルサイズを削減しながらも、競争力ある精度を達成できる軽量なオプティカルフロー網は実現可能か?
  • RQ2提案されたCDDC層は、コストボリューム構築における計算コストを最小限に抑えつつ、大きな有効受容野を維持するのにどの程度有効か?
  • RQ3HEPP特徴抽出器は、標準的な特徴ピラミッドと比較して、より少ないパラメータで特徴表現をどの程度向上させるか?
  • RQ4SBDモジュールは、複数のピラミッドレベルにわたり、精度の低下を最小限に抑えつつ、どの程度の高速化を達成できるか?
  • RQ5完全なFastFlowNetアーキテクチャは、組み込みプラットフォーム上で効率的である一方で、実世界のドライブシーン(KITTI)においても強力な一般化性能を維持できるか?

主な発見

  • Sintel Final テストセットでは90.0%の精度を達成し、FlowNetC や SPyNet を上回り、13.4倍少ない計算量(12.2 GFLOPs)でLiteFlowNet の90%の性能を達成する。
  • KITTI 2015ベンチマークでは、PWC-Net や LiteFlowNetX と同等の結果を達成し、乗算加算計算コストが7.5倍も低い。
  • 1024×436解像度のSintel画像に対して、GTX 1080Ti では90 FPS、組み込み型Jetson TX2 GPU では5.7 FPS で実行され、エッジデバイス上でのリアルタイム推論を実証する。
  • モデルはたった1.37百万パラメータしか使用せず、FlowNet2 よりも120倍も小さく、他の最先端モデルと比較して顕著に効率的である。
  • アブレーションスタディにより、HEPP、CDDC、SBD の各モジュールが効率性と精度のトレードオフに寄与していることが確認され、SBD ではg=3を超えると利得の逓減が見られる。
  • KITTI 2015バリデーションセットでは、CDDC層が標準的な相関層よりも性能を向上させ、特に大規模な変位のシナリオで顕著な改善を示すが、Sintel では向上が見られない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。