Skip to main content
QUICK REVIEW

[論文レビュー] Human Action Recognition in Drone Videos using a Few Aerial Training Examples

Waqas Sultani, Mubarak Shah|arXiv (Cornell University)|Oct 22, 2019
Human Pose and Action Recognition被引用数 4
ひとこと要約

本論文では、実際の空中訓練例が僅かにしかない状況下で、ドローン映像における人間の行動認識を向上させるために、ビデオゲームからの合成データとGANで生成された空中特徴量を活用する非重複マルチタスク学習フレームワークを提案する。ゲーム映像とGANで生成された特徴量を交互に訓練することで統合し、平均68.2%の精度(YouTube-Aerial)および35.9%の精度(UCF-ARG)を達成し、実データの不足を合成データが効果的に補完できることを示している。

ABSTRACT

Drones are enabling new forms of human actions surveillance due to their low cost and fast mobility. However, using deep neural networks for automatic aerial action recognition is difficult due to the need for a large number of training aerial human action videos. Collecting a large number of human action aerial videos is costly, time-consuming, and difficult. In this paper, we explore two alternative data sources to improve aerial action classification when only a few training aerial examples are available. As a first data source, we resort to video games. We collect plenty of aerial game action videos using two gaming engines. For the second data source, we leverage conditional Wasserstein Generative Adversarial Networks to generate aerial features from ground videos. Given that both data sources have some limitations, e.g. game videos are biased towards specific actions categories (fighting, shooting, etc.,), and it is not easy to generate good discriminative GAN-generated features for all types of actions, we need to efficiently integrate two dataset sources with few available real aerial training videos. To address this challenge of the heterogeneous nature of the data, we propose to use a disjoint multitask learning framework. We feed the network with real and game, or real and GAN-generated data in an alternating fashion to obtain an improved action classifier. We validate the proposed approach on two aerial action datasets and demonstrate that features from aerial game videos and those generated from GAN can be extremely useful for an improved action recognition in real aerial videos when only a few real aerial training examples are available.

研究の動機と目的

  • ドローン映像における人間の行動認識のための実際の空中訓練映像が限られているという課題に対処すること。
  • 実データが不足する状況で、代替的なデータソース(ビデオゲームとGANで生成された特徴量)を活用して、限られた実際の空中データを補完すること。
  • ゲーム映像とGAN特徴量といった異種のデータソースと実際の空中例を統合する、強固な手法を開発すること。
  • データソース間のドメインシフトやラベルの不一致を考慮しても、空中行動分類の汎化性能と精度を向上させること。
  • 提案されたフレームワークの有効性を、ベンチマークとしての空中行動認識データセット上で検証すること。

提案手法

  • GTA や FIFA といったフォトリアリスティックなゲームエンジンを用いて、実世界のドローン環境を模倣する大規模な空中ゲーム映像を収集する。
  • 条件付きワサーストランスGANSを用いて、地上視点の映像から空中スタイルの特徴量を生成し、ドローンカメラの視点を模倣する。
  • ラベルやドメインの不一致に対処できるように、実データ、ゲームデータ、GANで生成されたデータを交互に学習する非重複マルチタスク学習フレームワークを設計する。
  • 実際の空中映像、ゲーム映像、GANで生成された特徴量の組み合わせを用いて行動分類器を訓練するが、各ソース間でラベルが一致している必要はない。
  • MFN-3D、I3D、ResNet-3D といった複数の3D CNNバックボーンを用いて、提案手法の堅牢性と汎化性能を異なるアーキテクチャで評価する。
  • 誤分類の低減を評価するために、混同行列とクラスごとの精度分析を実施する。

実験結果

リサーチクエスチョン

  • RQ1ビデオゲーム映像は、実際のドローン映像における行動認識を向上させるために実用的な合成データソースとして有効であるか?
  • RQ2実際の例が僅かしかない状況で、GANで生成された空中特徴量は実データを効果的に補完できるか?
  • RQ3ラベルが異なるゲーム映像とGANで生成された特徴量といった異種のデータソースを、1つの行動認識モデルに効果的に統合できるか?
  • RQ4非重複マルチタスク学習は、空中映像行動認識における分類精度の向上と、類似行動間の誤分類の低減に寄与するか?
  • RQ5提案手法は、異なる3D CNNアーキテクチャやベンチマークデータセットに対してどの程度汎化可能か?

主な発見

  • 非重複マルチタスク学習を用いてゲーム映像とGANで生成された特徴量を併用した場合、YouTube-Aerialデータセットで平均68.2%の精度を達成した。これは、実データのみで学習した場合(51.3%)や、1つの合成ソースのみで学習した場合よりも顕著な向上を示している。
  • UCF-ARGデータセットでは、ゲームデータとGANデータを併用した場合、平均35.92%の精度を達成した。これは、地上映像のみ(21.33%)や、1つの合成ソースのみで学習した場合よりも優れている。
  • 自転車、スイング、カヤック、運搬、手をたたく、走るといった明確な運動パターンを示す行動では、特に高い向上が見られ、特定のクラスで最大60%の精度上昇を記録した。
  • 混同行列の分析から、類似行動間の誤分類が顕著に低減しており、非DML(DMLなし)の51.3%から、両方のデータソースを用いたDMLでは64.5%まで全体の精度が向上した。
  • YouTube-Aerialの8クラス中5クラス、UCF-ARGの10クラス中6クラスで、両方の合成データソースを用いた場合、ベースラインを上回った。これは、強い汎化性能を示している。
  • 明確な運動の手がかりを持つ行動では特に効果的であったが、背景のバイアスが強い(例:ダイビング)または身体の動きが最小限の行動(例:スケートボード)では、やや効果が薄かった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。