Skip to main content
QUICK REVIEW

[論文レビュー] Self-Paced Video Data Augmentation with Dynamic Images Generated by Generative Adversarial Networks

Yumeng Zhang, Gaoguo Jia|arXiv (Cornell University)|Sep 16, 2019
Generative Adversarial Networks and Image Synthesis参考文献 29被引用数 4
ひとこと要約

本稿では、データ不足下での動画分類を向上させるために、GANによって生成された動的画像を用いた自己スケジューリング型動画データ拡張手法を提案する。動きを静止画に圧縮することで、カテゴリ固有の高品質な動的画像をGANが生成され、自己スケジューリング選択(SPS)戦略により信頼性の高いサンプルのみが抽出され、HMDB4*およびUCF4*のマイノリティクラスにおいて最大7.2%の精度向上を達成する。

ABSTRACT

There is an urgent need for an effective video classification method by means of a small number of samples. The deficiency of samples could be effectively alleviated by generating samples through Generative Adversarial Networks (GAN), but the generation of videos on a typical category remains to be underexplored since the complex actions and the changeable viewpoints are difficult to simulate. In this paper, we propose a generative data augmentation method for temporal stream of the Temporal Segment Networks with the dynamic image. The dynamic image compresses the motion information of video into a still image, removing the interference factors such as the background. Thus it is easier to generate images with categorical motion information using GAN. We use the generated dynamic images to enhance the features, with regularization achieved as well, thereby to achieve the effect of video augmentation. In order to deal with the uneven quality of generated images, we propose a Self-Paced Selection (SPS) method, which automatically selects the high-quality generated samples to be added to the network training. Our method is verified on two benchmark datasets, HMDB51 and UCF101. The experimental results show that the method can improve the accuracy of video classification under the circumstance of sample insufficiency and sample imbalance.

研究の動機と目的

  • 少数またはマイノリティな行動カテゴリに特化した動画分類の課題に取り組み、データ不足およびクラス不均衡の状況下での性能向上を図ること。
  • 高メモリ・高計算コストを要するため、複雑な動きや可変な視点に対応できない既存のGANベースの動画生成手法の限界を克服すること。
  • 完全な動画生成を必要とせず、時間ストリームネットワークを強化できるスケーラブルでモジュラーなデータ拡張フレームワークを構築すること。
  • GANによって生成された動的画像を正則化子として用いることで、少サンプル学習における過学習を軽減し、特徴学習を改善すること。
  • キーモーション意味を保持しつつ、低品質・ノイズの多い出力を除外するように、不均衡データセットにおける有効な訓練を可能にする合成サンプルの生成を実現すること。

提案手法

  • ランクプーリングを用いて動画の動きを1枚の静止画に圧縮することで、静的背景を除去し、動きの手がかりを保持する動的画像を生成する。
  • 動画セグメントからスパースサンプリングで抽出した多数の動的画像を用いてGANを学習させ、動きの意味を保持する画像を効率的に生成する。
  • カテゴリの識別性に基づいて、生成されたサンプルの品質を動的に評価し、信頼性の高いもののみを選択する自己スケジューリング選択(SPS)戦略を適用する。
  • 複数の訓練エポックにわたり、選択された合成動的画像を訓練セットに段階的に統合し、増強サンプルの数を徐々に増加させる。
  • 時間ストリームを有する時分割ネットワーク(TSN)をバックボーンとして採用し、生成された動的画像を活用して特徴学習と意思決定境界の一般化を向上させる。
  • エポックにわたるスケジュールに従いSPSを適用し、初期訓練段階での干渉を回避するとともに、段階的なモデル改善を確保する。

実験結果

リサーチクエスチョン

  • RQ1訓練データが不足する状況下で、GANによって生成された動的画像が動画分類モデルの拡張に有効に機能するか。
  • RQ2GAN生成サンプルの品質ばらつきをどのように軽減し、モデル学習に悪影響を及ぼさないか。
  • RQ3生動画フレームではなく動的画像を用いることで、動画分類におけるデータ拡張の実行可能性と性能が向上するか。
  • RQ4少数のサンプルが各クラスに割り当てられた不均衡データセットにおいて、合成動的画像が分類精度をどの程度向上できるか。
  • RQ5自己スケジューリング選択機構は、訓練に最も有用な合成サンプルを効果的に特定・優先できるか。

主な発見

  • 提案手法は、不均衡データで学習されたベースラインモデルと比較して、UCF4*サブセットで7.2%、HMDB4*サブセットで6.8%の精度向上を達成した。
  • UCF101*では91.3%、HMDB51*では60.4%の精度を達成し、不均衡データで学習された最先端手法(DI Net や Two-Stream I3D)を上回った。
  • 自己スケジューリング選択(SPS)機構により、低品質なGAN出力が効果的にフィルタリングされ、モデルの一般化性能が向上し、過学習が軽減された。
  • 生動画フレームではなく動的画像を用いることで、効果的なGANベースの拡張が可能になった。圧縮表現により重要な動き特徴が保持され、背景ノイズが最小限に抑えられた。
  • 3D-CNNベースライン(C3D、R3D、I3D)を大幅に上回り、SPS-GANで増強されたTSNベースのモデルはUCF4*で99.35%の精度を達成した。
  • 本手法は優れた一般化性能とモularityを示し、アーキテクチャの変更なしに既存の動画分類フレームワーク(TSNなど)と互換性を有していた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。