Skip to main content
QUICK REVIEW

[論文レビュー] Learning Discriminative Representations for Skeleton Based Action Recognition

Huanyu Zhou, Qingjie Liu|arXiv (Cornell University)|Mar 7, 2023
Human Pose and Action Recognition被引用数 4
ひとこと要約

本論文は、空間的・時間的分離と対照的学習を活用することで、骨格ベースの行動認識における判別表現を向上させる、プラグアンドプレイ型の特徴精錬ヘッド(FR-Head)を提案する。この手法は、信頼性の高いプロトタイプを用いて、動的かつ的確に曖昧なサンプルを同定・補正することで、NTU RGB+D、NTU RGB+D 120、NW-UCLA データセットで最先端の性能を達成し、曖昧な行動グループではトップ1精度が最大1.4%向上する。

ABSTRACT

Human action recognition aims at classifying the category of human action from a segment of a video. Recently, people have dived into designing GCN-based models to extract features from skeletons for performing this task, because skeleton representations are much more efficient and robust than other modalities such as RGB frames. However, when employing the skeleton data, some important clues like related items are also discarded. It results in some ambiguous actions that are hard to be distinguished and tend to be misclassified. To alleviate this problem, we propose an auxiliary feature refinement head (FR Head), which consists of spatial-temporal decoupling and contrastive feature refinement, to obtain discriminative representations of skeletons. Ambiguous samples are dynamically discovered and calibrated in the feature space. Furthermore, FR Head could be imposed on different stages of GCNs to build a multi-level refinement for stronger supervision. Extensive experiments are conducted on NTU RGB+D, NTU RGB+D 120, and NW-UCLA datasets. Our proposed models obtain competitive results from state-of-the-art methods and can help to discriminate those ambiguous samples. Codes are available at https://github.com/zhysora/FR-Head.

研究の動機と目的

  • 骨格ベースの手法における曖昧な行動認識の課題に対処すること。特に、文脈的・物体レベルの手がかりが欠落している場合に、類似した行動(例:書く、読む、タイプする)を区別することが難しいこと。
  • トレーニング中に同定された曖昧なサンプルに焦点を当て、対照的学習を用いて表現を精錬することで、特徴の判別能を向上させること。
  • さまざまなGCNベースのバックボーンに統合可能な軽量でモジュラーなコンponentsを設計し、複数レベルの特徴強化を実現すること。
  • バックボーンアーキテクチャを変更せずに、推論コストを増加させることなく、曖昧な行動グループにおける性能を向上させること。

提案手法

  • FR-Head は、元の特徴を空間的および時間的成分に分離することで、各次元に沿った集中した精錬を可能にし、判別的パターンへの感受性を向上させる。
  • 高い予測信頼度を持つサンプル(信頼性の高いサンプル)を特定し、クラスプロトタイプを維持するために、クラス内距離を最小化しクラス間距離を最大化する対照的損失を用いる。
  • 曖昧なサンプルは、特徴空間において正しいクラスプロトタイプに近づけるか、誤ったクラスプロトタイプから遠ざけることで、動的に補正される。
  • このモジュールは、GCNバックボーンの複数の段階に適用され、分類損失と対照的損失の共同最適化を介して、複数レベルの精錬を実現する。
  • 訓練の安定化と一般化性能の向上を図るため、モーメンタムベースのプロトタイプ更新戦略を採用する。
  • 従来のGCNモデルと互換性があり、推論時にはモジュールを削除可能であるため、実行時オーバーヘッドが生じない。

実験結果

リサーチクエスチョン

  • RQ1対照的学習を骨格ベースの行動認識における曖昧な行動の判別的表現学習に効果的に活用できるか?
  • RQ2空間的および時間的特徴をどのように分離・別々に精錬することで、微細な行動差に敏感なモデルを実現できるか?
  • RQ3プラグアンドプレイ型モジュールは、バックボーンアーキテクチャを変更せずに、曖昧な行動グループの性能を向上させることができるか?
  • RQ4GCNの段階を跨る複数レベルの精錬は、困難な行動カテゴリにおける認識精度をどの程度向上させるか?
  • RQ5曖昧な行動グループにおける精度と耐性の観点から、提案手法は最先端のモデルと比較してどの程度優れているか?

主な発見

  • 提案されたFR-Headは、NTU RGB+D 120のX-Subスプリットで92.8%のトップ1精度を達成し、以前の最先端手法CTR-GCNを0.4%上回った。
  • NTU RGB+DのX-Viewスプリットでは96.8%のトップ1精度を達成し、報告済みのすべての手法の中で最高位となった。
  • NW-UCLAデータセットでは96.8%のトップ1精度を達成し、新たな最先端結果を樹立した。
  • グループ別評価では、CTR-GCNと比較して曖昧な行動グループの精度が最大1.4ポイント向上した。
  • t-SNE可視化により、提案手法が曖昧な行動に対してよりコンパクトで明確に分離された特徴クラスタを生成することが確認された。
  • アブレーションスタディにより、空間的・時間的分離と対照的精錬の両方が性能向上に不可欠であることが検証され、それぞれが判別能向上に顕著な寄与を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。