Skip to main content
QUICK REVIEW

[論文レビュー] PERF-Net: Pose Empowered RGB-Flow Net

Yinxiao Li, Zhichao Lu|arXiv (Cornell University)|Sep 28, 2020
Human Pose and Action Recognition参考文献 46被引用数 9
ひとこと要約

PERF-Netは、人体ポーズ推定をRGBフレームに重ねて専用の入力ストリームとして統合するポーズに配慮したRGB-フローネットを提案する。RGB、フロー、ポーズストリームからの知識 distillation を用いて、推論時にフローまたはポーズを計算する必要がなくなる一方で、Kinetics-600(トップ1精度82.0)およびKinetics-700で最先端の性能を達成する。

ABSTRACT

In recent years, many works in the video action recognition literature have shown that two stream models (combining spatial and temporal input streams) are necessary for achieving state of the art performance. In this paper we show the benefits of including yet another stream based on human pose estimated from each frame -- specifically by rendering pose on input RGB frames. At first blush, this additional stream may seem redundant given that human pose is fully determined by RGB pixel values -- however we show (perhaps surprisingly) that this simple and flexible addition can provide complementary gains. Using this insight, we then propose a new model, which we dub PERF-Net (short for Pose Empowered RGB-Flow Net), which combines this new pose stream with the standard RGB and flow based input streams via distillation techniques and show that our model outperforms the state-of-the-art by a large margin in a number of human action recognition datasets while not requiring flow or pose to be explicitly computed at inference time. The proposed pose stream is also part of the winner solution of the ActivityNet Kinetics Challenge 2020.

研究の動機と目的

  • 明示的に人体ポーズをモダリティとして統合することで、標準のRGBおよびオプティカルフローストリームを超えて動画行動認識の性能が向上するかを調査すること。
  • 推論時にポーズを必要としない方法を開発し、効率的なデプロイを可能にすること。
  • 3D CNNにおけるポーズベースの注目を強化しつつ、文脈的情報を保持する効果的なポーズレンダリング技術を調査すること。
  • RGB、フロー、ポーズの複数モダリティからのdistillationが、単一ストリームのRGBオンativeモデルを優れたものにできるかを示すこと。
  • 微調整なしで、下流の行動認識ベンチマークにおけるモデルの汎化性とロバスト性を検証すること。

提案手法

  • ポーズストリームは、人体キーポイントのヒートマップを明確に色分けされた線に変換し、各RGBフレームに直接重ねることで作成され、空間的および文脈的関係が保持される。
  • 複数教師distillationフレームワークを採用し、RGBのみで学習する学生モデルが、RGB、オプティカルフロー、ポーズストリームで学習された教師モデルから学ぶ。
  • フローおよびポーズストリームそれぞれに別々のdistillation損失を適用することで、学生モデルのアーキテクチャを変更せずに知識伝達が可能になる。
  • 訓練中にモダリティ間の特徴の重要度を動的に調節する自己ゲーティング機構を導入した。
  • 最終的なモデル、PERF-Netは、3つの異なる入力モダリティからの知識をdistillationすることで、SOTA性能を達成する単一ストリームのRGBオンリーネットワークである。
  • 事前学習はKinetics-600およびKinetics-700で実施し、その後、Ucf-101やHMDB-51などの下流データセットで微調整を行うが、さらにdistillationは行わない。

実験結果

リサーチクエスチョン

  • RQ1RGBおよびオプティカルフローとは別にポーズストリームを入力モダリティとして統合することで、動画行動認識において補完的な利点が得られるか?
  • RQ2ポーズおよびフローのストリームからの知識distillationが、推論時にそれらの入力を必要としない単一のRGBオンリーモデルに効果的に知識を伝達できるか?
  • RQ3ポーズレンダリング手法の選択(例:重ね合わせ vs. 単独入力)が、モデル性能および注目パターンに与える影響は?
  • RQ4微調整が最小限で済む状況において、distilled PERF-Netモデルが、クラス数が少ないまたは多い下流データセットにどれほど汎化できるか?
  • RQ5ポーズストリームは、特に曖昧な行動クラス(例:『バーベルスクリッチアップ』対『ベンチプレス』)において、関連する身体部位への注目を向上させるか?

主な発見

  • PERF-NetはKinetics-600で82.0のトップ1精度を達成し、最先端の単一ストリームモデルを大きく上回る。
  • Kinetics-700では、82.0のトップ1精度を達成し、クラス数およびデータの複雑さが増加する中でも強い汎化性能を示した。
  • UCF-101(98.6%精度)およびHMDB-51(83.2%精度)において、アンサンブル手法を含む既存のすべての単一ストリームモデルを上回った。
  • 定性的な分析から、ポーズストリームが人体全体への注目を促進し、『バーベルスクリッチアップ』対『ベンチプレス』のような曖昧な行動において補完的な信号を提供することがわかった。
  • アブレーションスタディにより、RGBフレームにポーズを重ねることが極めて重要であることが確認された。単独のポーズ入力では顕著に性能が劣った。
  • 微調整が最小限で済む状況において、下流データセットへの汎化性能が高く、UCF-101およびHMDB-51の両方でSOTA性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。