Skip to main content
QUICK REVIEW

[論文レビュー] Hierarchical Contrast for Unsupervised Skeleton-based Action Representation Learning

Jianfeng Dong, Shengkai Sun|arXiv (Cornell University)|Dec 5, 2022
Human Pose and Action Recognition被引用数 6
ひとこと要約

本論文は、時間的および空間的ドメインからマルチレベルの特徴を学習し、4つのレベル(インスタンス、ドメイン、クリップ、パーツ)で対照的学習を実行する、新しい非教師あり骨格ベースの行動表現学習フレームワークであるHierarchical Contrast (HiCo)を提案する。HiCoは4つのデータセットにおいて行動認識および検索タスクで最先端の性能を達成し、低リソースまたは半教師あり設定下でも優れた転送性と有効性を示している。

ABSTRACT

This paper targets unsupervised skeleton-based action representation learning and proposes a new Hierarchical Contrast (HiCo) framework. Different from the existing contrastive-based solutions that typically represent an input skeleton sequence into instance-level features and perform contrast holistically, our proposed HiCo represents the input into multiple-level features and performs contrast in a hierarchical manner. Specifically, given a human skeleton sequence, we represent it into multiple feature vectors of different granularities from both temporal and spatial domains via sequence-to-sequence (S2S) encoders and unified downsampling modules. Besides, the hierarchical contrast is conducted in terms of four levels: instance level, domain level, clip level, and part level. Moreover, HiCo is orthogonal to the S2S encoder, which allows us to flexibly embrace state-of-the-art S2S encoders. Extensive experiments on four datasets, i.e., NTU-60, NTU-120, PKU-MMD I and II, show that HiCo achieves a new state-of-the-art for unsupervised skeleton-based action representation learning in two downstream tasks including action recognition and retrieval, and its learned action representation is of good transferability. Besides, we also show that our framework is effective for semi-supervised skeleton-based action recognition. Our code is available at https://github.com/HuiGuanLab/HiCo.

研究の動機と目的

  • 既存の対照的学習手法が、通常は全体的なインスタンスレベルの対照にとどまり、人間の骨格の階層的構造を活用しないという制限を解消すること。
  • 二重ブランチエンコーダー構造を用いて、パーツレベル、クリップレベル、ドメインレベル、インスタンスレベルという複数の粒度で骨格をモデル化することで、非教師あり表現学習を向上させること。
  • 人間の運動の内在的な階層的性質に合わせて、4つの異なるレベルで階層的対照的学習を実施することで、特徴の判別性を向上させること。
  • 行動認識や検索などの下流タスクへの学習済み表現の転送性を強化し、リソースが限られた環境や半教師あり設定下でも高い性能を発揮すること。

提案手法

  • HiCoは、時間的モデリング(異なる長さのクリップとして処理される骨格シーケンス)を目的としたブランチと、異なるサイズの身体部位からの特徴抽出を目的としたブランチの2本のエンコーダーから構成される。
  • フレームワークは、シーケンス・ツー・シーケンス(S2S)エンコーダーと統一されたダウンサンプリングモジュールを用いて、時間的および空間的ドメインにおけるマルチグレインの特徴を生成する。
  • 階層的対照は4つのレベルで実施される:インスタンスレベル(異なる骨格シーケンス間)、ドメインレベル(異なるデータ分割間)、クリップレベル(時間的クリップ内)、パーツレベル(空間的身体部位内)。
  • この手法はS2Sエンコーダーと直交しており、Transformerなどの最先端のエンコーダーと統合可能であり、柔軟なアーキテクチャ設計を可能にする。
  • 対照的損失は各レベルに適用され、段階的な精錬が行われる:パーツレベルの特徴がクリップレベルに統合され、次にドメインレベルに統合され、最終的にインスタンスレベルの表現に統合される。
  • データ拡張を用いて対照的学習のためのポジティブペアを生成し、フレームワークは非教師ありでエンドツーエンドに訓練される。

実験結果

リサーチクエスチョン

  • RQ1従来のインスタンスレベルの対照と比較して、複数の粒度で階層的対照的学習を実施することで、非教師あり骨格ベースの行動表現学習が向上するか?
  • RQ2時間的および空間的マルチグレイン表現の統合が、特徴の判別性とモデルの一般化性能をどのように向上させるか?
  • RQ3提案されたHiCoフレームワークが、異なるデータセットにおける行動認識や検索などの下流タスクにどの程度一般化可能か?
  • RQ4ラベル付きデータが限られる低ショットまたは半教師あり設定下で、HiCoはどの程度有効か?

主な発見

  • HiCoは、NTU-60、NTU-120、PKU-MMD I、PKU-MMD IIという4つのベンチマークデータセットにおいて、行動認識および検索タスクで最先端の性能を達成した。先行する非教師あり手法と比較して、精度が向上した。
  • NTU-60データセットのx-subプロトコルにおいて、HiCo-Transformerは81.1%の精度を達成し、以前の最先端手法(CrosSCLR)を1.4ポイント上回った。
  • 転移学習において、HiCoはNTU-60で事前学習した後、PKU-MMD IIで56.3%の精度を達成し、LongT GAN(44.8%)やISC(45.9%)といった先行手法を大きく上回った。
  • NTU-60で1%のラベル付きデータしか利用しない半教師あり学習設定下でも、HiCo-Transformerは54.4%の精度を達成し、パrameter数がより大きなベースラインすべてを上回った。
  • アブレーションスタディの結果、階層的対照が不可欠であることが確認された。ドメインレベルおよびクリップ&パーツレベルの対照を段階的に追加することで、一貫した性能向上が得られ、4レベルすべての対照が最良の結果をもたらした。
  • 時間的および空間的ブランチの二重構造は、単一ブランチの変種よりも効果的であり、時間的ダイナミクスと空間的身体部位構造の両方のモデリングによる補完的利点を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。