Skip to main content
QUICK REVIEW

[論文レビュー] Cross-Model Pseudo-Labeling for Semi-Supervised Action Recognition

Yinghao Xu, Fangyun Wei|arXiv (Cornell University)|Dec 17, 2021
Human Pose and Action Recognition被引用数 6
ひとこと要約

本論文は、異なるアーキテクチャのバイアスを持つ軽量な補助ネットワークを用いて、主なバックボーンネットワークの補完的疑似ラベルを生成する半教師あり行動認識手法であるCross-Model Pseudo-Labeling (CMPL)を提案する。クロスモデル予測を活用することで、疑似ラベルの品質を著しく向上させ、1%のラベル付きデータのみを用いてKinetics-400で17.6%、UCF-101で25.1%のTop-1精度を達成し、FixMatchをそれぞれ9.0%および10.3%上回る性能を発揮した。

ABSTRACT

Semi-supervised action recognition is a challenging but important task due to the high cost of data annotation. A common approach to this problem is to assign unlabeled data with pseudo-labels, which are then used as additional supervision in training. Typically in recent work, the pseudo-labels are obtained by training a model on the labeled data, and then using confident predictions from the model to teach itself. In this work, we propose a more effective pseudo-labeling scheme, called Cross-Model Pseudo-Labeling (CMPL). Concretely, we introduce a lightweight auxiliary network in addition to the primary backbone, and ask them to predict pseudo-labels for each other. We observe that, due to their different structural biases, these two models tend to learn complementary representations from the same video clips. Each model can thus benefit from its counterpart by utilizing cross-model predictions as supervision. Experiments on different data partition protocols demonstrate the significant improvement of our framework over existing alternatives. For example, CMPL achieves $17.6\%$ and $25.1\%$ Top-1 accuracy on Kinetics-400 and UCF-101 using only the RGB modality and $1\%$ labeled data, outperforming our baseline model, FixMatch, by $9.0\%$ and $10.3\%$, respectively.

研究の動機と目的

  • 行動認識における高コストなラベル付けの課題を、大規模な未ラベル付き動画データを活用することで解決すること。
  • 異なる構造的バイアスを持つモデルからの補完的表現を活用することで、半教師あり学習における疑似ラベル品質を向上させること。
  • 主なバックボーンと軽量な補助ネットワークの間で、クロスモデル疑似ラベル付けを通じて相互監視を可能にするフレームワークを開発すること。
  • モデルレベルの補完性が、入力レベルのデータオーグメンテーションや自己教師あり学習を上回る性能向上を実現できることを示すこと。

提案手法

  • 主なバックボーンとは異なるアーキテクチャでチャネル数が少ない軽量な補助ネットワークを導入し、補完的表現を生成すること。
  • 補助ネットワークの信頼性の高い予測を主なバックボーンの疑似ラベルとして、逆に主なバックボーンの予測を補助ネットワークの疑似ラベルとして用い、クロスモデル監視を実現すること。
  • 両ネットワークを一括して学習し、一貫性正則化と疑似ラベル付けを適用する。各モデルは相手の高信頼度予測から学習する。
  • 耐性と汎化性能を向上させるために、標準的な時間的データオーグメンテーション(例:フレームレート変更や時間シフト)を適用すること。
  • 両モデルが互いの疑似ラベルを用いて更新される対称的な学習目的を採用し、両方向への知識蒸留を促進すること。
  • 標準的なベンチマーク(例:Kinetics-400やUCF-101)を用い、低データ環境(例:1%ラベル付きデータ)下での性能を評価すること。

実験結果

リサーチクエスチョン

  • RQ1異なる構造的バイアスを持つモデルは、単一のモデルよりも信頼性が高く補完的な疑似ラベルを生成できるか?
  • RQ2自己疑似ラベル付けベースラインと比較して、クロスモデル疑似ラベル付けは半教師あり行動認識性能を向上させるか?
  • RQ3主なバックボーンの性能と、補助ネットワークが個々の行動カテゴリで達成する精度の間にはどのような相関関係があるか?
  • RQ4補助ネットワークが時間的ダイナミクスをどれだけ効果的に捉えられるかが、主なネットワークの空間的理解をどの程度補完するか?

主な発見

  • CMPLは、RGBモodalのみと1%のラベル付きデータを用いて、Kinetics-400で17.6%、UCF-101で25.1%のTop-1精度を達成し、FixMatchをそれぞれ9.0%および10.3%上回った。
  • 同じ未ラベル付きデータサブセットにおいて、補助ネットワークが主なバックボーンよりも高品質な疑似ラベルを生成していることが、学習曲線の一貫した精度上昇から明らかになった。
  • 補助ネットワークの性能が良い行動カテゴリでは、主なバックボーンの性能が顕著に向上しており、両モデルの補完的性質が裏付けられた。
  • CMPLでは、FixMatchよりも正しい疑似ラベルの割合が高かったため、未ラベル付きデータの利用効率が優れていた。
  • 主なバックボーンの性能向上は、補助ネットワークの各カテゴリにおける精度と正の相関関係にあり、補完的学習メカニズムの有効性が検証された。
  • 補助ネットワークの容量が低くてもフレームワークは有効であるため、小規模で特化したモデルから大規模なモデルへの知識伝達が可能であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。