[論文レビュー] Generative Action Description Prompts for Skeleton-based Action Recognition
本稿では、事前学習言語モデル(GPT-3)を活用して、動作と身体部位の動きに関する詳細なテキスト記述を自動生成する、骨格ベースの動作認識のための新規なマルチモーダル学習フレームワーク「Generative Action-description Prompts(GAP)」を提案する。対照的損失を用いてこれらの記述を骨格特徴とアライメントさせることで、推論コストを追加せずに表現学習を向上させ、NTU RGB+D、NTU RGB+D 120、NW-UCLAのベンチマークで最先端の性能を達成する。
Skeleton-based action recognition has recently received considerable attention. Current approaches to skeleton-based action recognition are typically formulated as one-hot classification tasks and do not fully exploit the semantic relations between actions. For example, "make victory sign" and "thumb up" are two actions of hand gestures, whose major difference lies in the movement of hands. This information is agnostic from the categorical one-hot encoding of action classes but could be unveiled from the action description. Therefore, utilizing action description in training could potentially benefit representation learning. In this work, we propose a Generative Action-description Prompts (GAP) approach for skeleton-based action recognition. More specifically, we employ a pre-trained large-scale language model as the knowledge engine to automatically generate text descriptions for body parts movements of actions, and propose a multi-modal training scheme by utilizing the text encoder to generate feature vectors for different body parts and supervise the skeleton encoder for action representation learning. Experiments show that our proposed GAP method achieves noticeable improvements over various baseline models without extra computation cost at inference. GAP achieves new state-of-the-arts on popular skeleton-based action recognition benchmarks, including NTU RGB+D, NTU RGB+D 120 and NW-UCLA. The source code is available at https://github.com/MartinXM/GAP.
研究の動機と目的
- 『勝利のサインをする』と『サムズアップ』のような類似動作間の微細な意味的差を1-of-K分類では捉えきれないという限界を解消すること。
- 動作および身体部位の自然言語記述が、骨格ベースの動作認識における表現学習をどのように向上させるかを検討すること。
- 高価な人手による骨格-テキストデータセットの作成を回避する、低コストでスケーラブルなマルチモーダル学習パラダイムを構築すること。
- 身体部位の動きや動作意味論に関する事前知識を組み込むことで、一般化性能の向上と特徴のアライメントを実現すること。
- 推論時の計算コストを追加せずに、標準ベンチマークで最先端の性能を達成すること。
提案手法
- プロンプトテンプレートを用いて、GPT-3を知識エンジンとして活用し、動作および個々の身体部位の詳細で構造化されたテキスト記述を自動生成する。
- 関節座標を処理する骨格エンコーダと、生成された記述を処理するテキストエンコーダを備えたデュアルエンコーダフレームワークを設計する。
- 身体部位のテキストエンコーディング特徴を、対応する骨格エンコーディング特徴とアライメントさせるために、マルチパーツ対照的損失を適用する。
- グローバルな動作埋め込みにおけるクロスエントロピー損失と、パーツレベル特徴における対照的損失を組み合わせることで、表現学習を向上させる。
- テキストエンコーダはトレーニング時のみ有効にし、骨格エンコーダは分類と対照的監視の両方を用いて学習する。
- GPT-3によるオフラインでの記述生成を採用し、トレーニングまたはテスト時にリアルタイムのLLM推論を回避する。
実験結果
リサーチクエスチョン
- RQ1自動生成された自然言語による動作および身体部位の記述は、骨格ベースの動作認識を向上させることができるか?
- RQ2動作記述からの意味的知識を組み込むことで、微細な動作表現の学習にどのような影響を与えるか?
- RQ3LLMが生成したプロンプトを用いたマルチモーダル学習方式は、標準的な1-of-K分類ベースラインを上回る性能を発揮できるか?
- RQ4本手法は、身体部位の動きに微細な差があるような多様な動作カテゴリに一般化可能か?
- RQ5推論時に計算コストを追加せずに、SOTA性能を達成できるか?
主な発見
- GAPは、追加の推論計算コストを一切負担せずに、NTU RGB+D、NTU RGB+D 120、NW-UCLAベンチマークで最先端の性能を達成した。
- 『勝利のサインをする』と『サムズアップ』の違いを手の動きの記述によって明確に区別できるような意味的差を活用することで、表現学習が向上した。
- マルチパーツ対照的損失の導入により、骨格とテキストによる身体部位表現間の特徴アライメントが顕著に向上した。
- フレームワークは、人手によるテキストデータが存在しないゼロショットやフェイントショットの設定でも、LLMが生成した記述が効果的な監視信号として機能することを示した。
- 実験により、GCN、ST-GCN、Graphorを含む複数のベースラインモデルにおいて、本手法が一貫して精度を向上させることを確認した。
- アブレーションスタディの結果、グローバルおよびパーツレベルのテキスト監視の両方が性能向上に寄与しており、特にパーツレベルの対照的損失が微細な動作識別に顕著に効果的であることが判明した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。