Skip to main content
QUICK REVIEW

[論文レビュー] Learning Human Optical Flow

Anurag Ranjan, Javier Romero|arXiv (Cornell University)|Jun 14, 2018
Human Pose and Action Recognition参考文献 30被引用数 3
ひとこと要約

本稿では、146,020 個の人体運動シーケンスと真値のオプティカルフローを備えた大規模な合成データセットを用いて、人体運動に特化して訓練された深層学習ベースのオプティカルフロー手法 HumanFlow を提案する。このデータセットでスパイネットをファインチューニングし、エンドツーエンドで訓練可能にすることで、人体運動分野における最先端の汎用フロー手法よりも30%高い精度を達成するとともに、リアルタイムで32 fpsで動作し、モデルサイズはたったの7.8 MBである。

ABSTRACT

The optical flow of humans is well known to be useful for the analysis of human action. Given this, we devise an optical flow algorithm specifically for human motion and show that it is superior to generic flow methods. Designing a method by hand is impractical, so we develop a new training database of image sequences with ground truth optical flow. For this we use a 3D model of the human body and motion capture data to synthesize realistic flow fields. We then train a convolutional neural network to estimate human flow fields from pairs of images. Since many applications in human motion analysis depend on speed, and we anticipate mobile applications, we base our method on SpyNet with several modifications. We demonstrate that our trained network is more accurate than a wide range of top methods on held-out test data and that it generalizes well to real image sequences. When combined with a person detector/tracker, the approach provides a full solution to the problem of 2D human flow estimation. Both the code and the dataset are available for research.

研究の動機と目的

  • 人体運動に特化したオプティカルフロー手法の不足に取り組むこと。人体運動は関節運動、自己遮蔽、外観の変動のため、複雑である。
  • 正確なリアルワールド人体フローの収集が困難であるのを補うために、真値オプティカルフローを備えた大規模かつ現実的な合成データセットを構築すること。
  • リアルワールドの動画シーケンスに一般化可能な、人体用に特化した深層ニューラルネットワークを訓練すること。
  • モバイルおよび組み込みアプリケーションに適した軽量でリアルタイムなモデルを開発すること。
  • 研究の進展を促進するため、オープンソースのデータ、コード、および訓練済みモデルを提供すること。

提案手法

  • 著者らは、SMPLボディモデルとモーションキャプチャデータを用いて、多様な人体の形状、ポーズ、動きを含む現実的な屋内環境をシミュレートする146,020組の画像ペアを合成する。
  • 真値オプティカルフローは、人体の3次元運動を正確なピixeLレベルの運動ベクトルで2次元画像シーケンスにレンダリングすることで、合成的に生成される。
  • スパイネットに基づく畳み込みニューラルネットワークを、このHuman Flowデータセットでファインチューニングし、人体運動における性能向上を図るためのアーキテクチャ的変更を施す。
  • ネットワークをエンドツーエンドで訓練可能に拡張することで、特徴抽出とフロー推定の精度が向上する。
  • 効率性最適化により、420万パラメータで7.8 MBのコンパクトなネットワークが得られ、標準ハードウェアで32 fpsで動作する。
  • リアルワールド評価のため、DPM人間検出器を用いて動画から人間領域を切り出し、その切り出しシーケンスに対してモデルを適用してフローを推定する。

実験結果

リサーチクエスチョン

  • RQ1大規模な合成人体運動データセットで訓練されたディープラーニングモデルは、人体固有の運動推定において、汎用オプティカルフロー手法を上回る性能を示せるか?
  • RQ2人体運動でファインチューニングされたモデルは、複雑な背景と動きを伴うリアルワールド動画シーケンスに対しても、効果的に一般化できるか?
  • RQ3精度を犠牲にすることなく、人体運動に特化したコンパクトでリアルタイムなオプティカルフローネットワークを訓練できるか?
  • RQ4人体用に特化したフローモデルの性能は、人体運動タスクにおけるSOTAの汎用フロー手法と比べてどの程度優れているか?
  • RQ5事前学習されたバックボーンと比較して、エンドツーエンド学習は人体運動のフローより推定精度をどの程度向上させるか?

主な発見

  • HumanFlowモデルは、Human Flowデータセット上で平均終点誤差(AEPE)を測定したところ、以前のSOTAオプティカルフロー手法よりも30%高い精度を達成した。
  • モデルはリアルワールドのシーンに対しても良好に一般化され、手、脚、頭部などの細かな人体部の解消において、遮蔽下でも視覚的に優れた結果を生み出している。
  • HumanFlowは1枚のGPUで32フレーム/秒で動作し、モバイルおよび組み込みデバイスにおけるリアルタイムアプリケーションに適している。
  • モデルは非常にコンパクトで、メモリ使用量はたったの7.8 MB、学習可能なパラメータは420万個であり、効率的なデプロイメントが可能である。
  • 視覚的比較では、SPyNet、LDOF、EpicFlow、FlowFieldsといった手法と比較して、特に複雑な動きを示す領域で、HumanFlowはより一貫性があり正確なフローフィールドを生成している。
  • リアルなテクスチャと背景を備えた合成データセットを用いることで、高品質な学習が可能となり、高価なリアルワールドアノテーションの必要がなくなる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。