Skip to main content
QUICK REVIEW

[論文レビュー] Metric-Based Few-Shot Learning for Video Action Recognition

Chris Careaga, Brian Hutchinson|arXiv (Cornell University)|Sep 14, 2019
Human Pose and Action Recognition参考文献 38被引用数 19
ひとこと要約

本論文は、プールドLSTMとプロトタイプネットワークを用いた2ストリーム動画エンコーダーを用いたメトリクスベースの少サンプル学習フレームワークを提案する。Kinetics 600の少サンプルスプリットを用いた5ウェイ5ショットタスクにおいて84.2%の精度を達成し、単純で効率的なアーキテクチャが、顕著に少ないパラメータ数で最先端の性能を達成できることを示している。

ABSTRACT

In the few-shot scenario, a learner must effectively generalize to unseen classes given a small support set of labeled examples. While a relatively large amount of research has gone into few-shot learning for image classification, little work has been done on few-shot video classification. In this work, we address the task of few-shot video action recognition with a set of two-stream models. We evaluate the performance of a set of convolutional and recurrent neural network video encoder architectures used in conjunction with three popular metric-based few-shot algorithms. We train and evaluate using a few-shot split of the Kinetics 600 dataset. Our experiments confirm the importance of the two-stream setup, and find prototypical networks and pooled long short-term memory network embeddings to give the best performance as few-shot method and video encoder, respectively. For a 5-shot 5-way task, this setup obtains 84.2% accuracy on the test set and 59.4% on a special "challenge" test set, composed of highly confusable classes.

研究の動機と目的

  • 少サンプル画像分類における進展にもかかわらず、少サンプル動画行動認識分野における研究の不足に対処すること。
  • 異なる動画エンコーダー構造とメトリクスベースの少サンプル学習手法が、少サンプル動画タスクにおいてどのように性能を発揮するかを評価すること。
  • 光学フローとフレームレートが、少サンプル動画表現学習において果たす役割を調査すること。
  • 効率的で軽量なモデルが、少サンプル動画認識において最先端の性能を達成できることを示すこと。

提案手法

  • 外見と動きの特徴を捉えるために、RGBと光学フロー入力を備えた2ストリーム動画エンコーダーを用いる。
  • フレームレベル特徴を時系列的な動画レベル埋め込みに集約するために、プールドLSTMネットワークを採用する。
  • 分類に向け、3つのメトリクスベースの少サンプル学習手法(プロトタイプネットワーク、マッチングネットワーク、学習可能メトリックネットワーク)を適用する。
  • 5ウェイ5ショットエピソードを用いたKinetics 600データセットの少サンプルスプリット上で、エピソードベースのメタラーニングを用いてモデルを訓練する。
  • フレームレベル埋め込みの集約戦略として、特徴量の平均化、LSTM、ConvLSTM、3次元畳み込みを用いる。
  • 一般テストセットと、類似度の高い行動クラスが混在する困難なテストセットの両方で性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1異なる動画エンコーダー構造は、少サンプル動画行動認識性能にどのように影響するか?
  • RQ2RGBストリームと光学フローストリームの相対的寄与度は何か?
  • RQ31 fpsを超えるフレームレートの向上は、少サンプル動画認識精度を向上させるか?
  • RQ4プロトタイプネットワークのような単純なメトリクスベース手法は、複雑なバックボーンを用いずに競争力のある性能を達成できるか?
  • RQ5一般クラスと比較して、類似度の高い行動クラスにおいてモデル性能はどの程度低下するか?

主な発見

  • プールドLSTM動画エンコーダーとプロトタイプネットワークの組み合わせが、5ウェイ5ショットタスクにおける一般テストセットで最高の84.2%の精度を達成した。
  • 類似度の高い行動クラスから構成されるチャレンジングテストセットでは、精度が著しく59.4%に低下し、微細な行動認識の難易度が浮き彫りになった。
  • RGBを除いた単一の光学フロー入力では、性能が19.6%低下し、動きの特徴が外見特徴よりも重要であることが示された。
  • 1 fps入力ではなく単一フレームを用いる場合、精度は約10%低下し、時系列的文脈が少サンプル動画学習において不可欠であることが示された。
  • 1 fpsを超えるフレームレートの向上は、顕著な改善をもたらさず、1 fpsが効果的な少サンプル学習に十分であることが示唆された。
  • フレーム埋め込みの単純な平均化は、LSTM集約とほぼ同等の効果を示し、複雑な時系列モデリングが常に必要であるとは限らないことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。