Skip to main content
QUICK REVIEW

[論文レビュー] VideoSSL: Semi-Supervised Learning for Video Classification

Longlong Jing, Toufiq Parag|arXiv (Cornell University)|Feb 29, 2020
Human Pose and Action Recognition参考文献 46被引用数 6
ひとこと要約

この論文では、未ラベル付き動画クリップからの疑似ラベルと、事前学習済み2次元画像分類器からの外見ベースの正則化を活用する半教師あり学習手法であるVideoSSLを提案する。これらの2つの監視信号を組み合わせることで、UCF101、HMDB51、Kineticsデータセットにおいて、ラベル付きデータの10–20%のみを用いても、最先端の性能を達成し、完全教師あり学習を上回る。

ABSTRACT

We propose a semi-supervised learning approach for video classification, VideoSSL, using convolutional neural networks (CNN). Like other computer vision tasks, existing supervised video classification methods demand a large amount of labeled data to attain good performance. However, annotation of a large dataset is expensive and time consuming. To minimize the dependence on a large annotated dataset, our proposed semi-supervised method trains from a small number of labeled examples and exploits two regulatory signals from unlabeled data. The first signal is the pseudo-labels of unlabeled examples computed from the confidences of the CNN being trained. The other is the normalized probabilities, as predicted by an image classifier CNN, that captures the information about appearances of the interesting objects in the video. We show that, under the supervision of these guiding signals from unlabeled examples, a video classification CNN can achieve impressive performances utilizing a small fraction of annotated examples on three publicly available datasets: UCF101, HMDB51 and Kinetics.

研究の動機と目的

  • 大規模なラベル付き動画データセットへの依存を減らすため。これらのデータセットは作成に費用がかかり、時間がかかる。
  • 2次元画像タスクで効果的であった半教師あり学習技術を、より複雑な時空間的領域である動画分類に適応するため。
  • 未ラベルデータを二重の監視信号を通じて活用することで、ラベル付き例のわずかな割合のみを用いて3D CNNの性能を向上させ、動画分類の性能を向上させるため。
  • オブジェクトレベルの特徴からの外見的手がかりが、低監視下での動画行動認識を顕著に向上させる可能性があるかどうかを調査するため。

提案手法

  • 未ラベル付き動画クリップの訓練中にCNNの信頼度スコアから生成された疑似ラベルを用いて、監視信号を提供する。
  • 各動画のランダムフレームに適用された、事前学習済み2次元画像分類器からの外見特徴を、3次元動画分類器の正則化に組み込む。
  • 2次元画像分類器の予測確率を正則化信号として用い、3次元CNNがより判別力のある時空間的特徴を学習するように誘導する。
  • ラベル付きデータに対する教師あり損失と、未ラベル付きデータに対する一貫性正則化を組み合わせて、エンドツーエンドで訓練する。
  • 本手法は、ResNet-18を含むさまざまな3次元CNNアーキテクチャと互換性があり、異なる動画データセットに適用可能である。
  • 未ラベル付きデータに対する高信頼度予測を用いて、モデルの信頼性を評価し、アクティブラーニングの応用を支援する。

実験結果

リサーチクエスチョン

  • RQ12次元画像タスクで効果的であった半教師あり学習技術を、3次元CNNを用いた動画分類に効果的に適応できるか?
  • RQ22次元画像分類器の予測から得られる外見的手がかりを組み込むことで、低監視下での動画分類精度が向上するか?
  • RQ3疑似ラベル付けと外見正則化を組み合わせることで、大規模なラベル付き動画データセットの必要性をどの程度まで低減できるか?
  • RQ4さまざまな動画データセットにおいて、提案手法の性能は完全教師あり学習および他の半教師ありベースラインと比べてどの程度か?

主な発見

  • UCF101、HMDB51、Kineticsにおいて、VideoSSLはラベル付きデータを10–20%のみ使用した場合、完全教師あり学習よりも最大20%高い精度を達成した。
  • ラベル付きデータをたった10%のみ使用した場合でも、以前の研究で全データセットを用いて完全教師あり学習された3D ResNet-18モデルの精度を上回った。
  • UCF101の90%のカテゴリにおいて、10%のラベルを使用した際、提案手法は教師ありベースラインを上回るトップ1精度を達成し、ボクシングやフェンシングのような特定の行動では40%を超える改善が見られた。
  • 未ラベル付き動画の90%以上が、高い信頼度(0.95以上)で予測され、正しく分類されていたため、モデルの信頼性が高く、アクティブラーニングの可能性が示された。
  • 外見的手がかりを活用することで、『フリスビー投げ』と『フットボールパス』を誤って混同するような、教師ありモデルで一般的な誤分類エラーを顕著に低減した。
  • 疑似ラベル付けと外見正則化の組み合わせにより、3つのベンチマークデータセットすべてで一貫した性能向上が得られ、堅牢性と一般化性能が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。