Skip to main content
QUICK REVIEW

[論文レビュー] Towards High Performance Video Object Detection

Xizhou Zhu, Jifeng Dai|arXiv (Cornell University)|Nov 30, 2017
Advanced Neural Network Applications参考文献 31被引用数 6
ひとこと要約

本稿では、疎行列再帰的特徴集約、空間的に適応する部分的特徴更新、時間的に適応するキーフレームスケジューリングを統合したエンド・ツー・エンドの動画オブジェクト検出フレームワークを提案する。これにより、最先端のスピード・アキュラシー・トレードオフを達成する。15.2 fpsで77.8% mAPを達成し、ImageNet VID 2017 優勝者を上回る性能を発揮する。

ABSTRACT

There has been significant progresses for image object detection in recent years. Nevertheless, video object detection has received little attention, although it is more challenging and more important in practical scenarios. Built upon the recent works, this work proposes a unified approach based on the principle of multi-frame end-to-end learning of features and cross-frame motion. Our approach extends prior works with three new techniques and steadily pushes forward the performance envelope (speed-accuracy tradeoff), towards high performance video object detection.

研究の動機と目的

  • 動きぼけや外観の変化による動画オブジェクト検出における高い計算コストと精度の低下を是正すること。
  • 疎特徴伝搬の長所と密特徴集約の長所を統合しつつ、それぞれの欠点を最小限に抑えること。
  • 特徴更新の適応的処理とキーフレームスケジューリングにより、推論速度を損なわず検出精度を向上させること。
  • 高性能な動画オブジェクト検出のための原理的でエンド・ツー・エンドで訓練可能なフレームワークを構築すること。

提案手法

  • 疎なキーフレームでのみ密な特徴集約を実行する疎行列再帰的特徴集約を導入し、計算量を削減しながら特徴の質を維持する。
  • 空間的に適応する部分的特徴更新を採用し、伝搬された特徴が低品質と判別された領域でのみ非キーフレームの特徴を再計算する。この処理はエンド・ツー・エンドで学習される。
  • 予測された特徴品質に基づいて動的にキーフレームを選択する時間的に適応するキーフレームスケジューリングを提案。固定スケジューリングに代わるものである。
  • 動き推定、特徴ワープ、検出を1つのエンド・ツー・エンドで訓練可能なネットワークに統合し、すべてのモジュールを統合最適化可能にする。
  • 効率的かつ正確な特徴伝搬を可能にするために、後向きの動き場を推定する軽量なフローネットを用いる。
  • 挑戦的な空間的配置でも精度を高めるために、可変畳み込みニューラルネットワーク(Deformable R-FCN)を検出ヘッドとして採用する。

実験結果

リサーチクエスチョン

  • RQ1統合フレームワークは、動画オブジェクト検出において、疎特徴伝搬の効率性と密特徴集約の精度を効果的に統合できるか?
  • RQ2完全再計算を伴わずに、非キーフレームでの特徴品質をどのように適応的に改善できるか?
  • RQ3特徴品質予測に基づく動的キーフレームスケジューリングは、固定スケジューリングに比べてより優れたスピード・アキュラシー・トレードオフを実現できるか?
  • RQ4動き推定、特徴伝搬、検出のエンド・ツー・エンド訓練は、段階的訓練に比べてどの程度性能を向上させるか?

主な発見

  • 本手法は、Titan X上で13.0 fpsで78.6% mAP、22.9 fpsで77.8% mAPを達成し、ImageNet VID 2017 優勝者(15.4 fpsで76.8% mAP)を上回る性能を発揮した。
  • 疎行列再帰的集約と適応的部分的更新の組み合わせにより、両方の先行研究[37]および[36]を個別に用いた場合よりも精度が向上した。
  • γ = 0.2の時間的に適応するキーフレームスケジューリングが、高速推論条件下で最良のスピード・アキュラシー・トレードオフを達成した。
  • FlowNetSを共同微調整で使用した場合が、最良のスピード・アキュラシー・トレードオフを達成し、高速なフローベクトル推定の重要性を示した。
  • Deformable R-FCNの導入により、さらなる性能向上が達成され、本フレームワークとの互換性と有効性が裏付けられた。
  • オラクルキーフレームスケジューリングポリシーは顕著に優れた結果を示し、適応的スケジューリングの潜在的可能性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。