[論文レビュー] Constructing Stronger and Faster Baselines for Skeleton-based Action Recognition
本稿では、骨格に基づく行動認識のための効率的で高精度なグラフ畳み込みニューラルネットワークベースラインであるEfficientGCN-Bxを提案する。ジョイント、モーション、ボーン特徴の早期融合、分離可能畳み込みの統合、およびコン poundスケーリングを採用することで、EfficientGCN-B4は、MS-G3D よりも 5.82倍小さく、5.85倍速く、NTU RGB+D 60 のクロスサブジェクトベンチマークで92.1%の最先端性能を達成した。
One essential problem in skeleton-based action recognition is how to extract discriminative features over all skeleton joints. However, the complexity of the recent State-Of-The-Art (SOTA) models for this task tends to be exceedingly sophisticated and over-parameterized. The low efficiency in model training and inference has increased the validation costs of model architectures in large-scale datasets. To address the above issue, recent advanced separable convolutional layers are embedded into an early fused Multiple Input Branches (MIB) network, constructing an efficient Graph Convolutional Network (GCN) baseline for skeleton-based action recognition. In addition, based on such the baseline, we design a compound scaling strategy to expand the model's width and depth synchronously, and eventually obtain a family of efficient GCN baselines with high accuracies and small amounts of trainable parameters, termed EfficientGCN-Bx, where "x" denotes the scaling coefficient. On two large-scale datasets, i.e., NTU RGB+D 60 and 120, the proposed EfficientGCN-B4 baseline outperforms other SOTA methods, e.g., achieving 91.7% accuracy on the cross-subject benchmark of NTU 60 dataset, while being 3.15x smaller and 3.21x faster than MS-G3D, which is one of the best SOTA methods. The source code in PyTorch version and the pretrained models are available at https://github.com/yfsong0709/EfficientGCNv1.
研究の動機と目的
- 骨格に基づく行動認識における最近の最先端モデルの高い計算コストと過剰パラメータ化の問題に対処すること。
- 冗長なパラメータと計算を最小限に抑えることで、性能を損なわずモデルの複雑さを低減すること。
- NTU RGB+D 60 や 120 の大規模データセットにおいても高い精度を維持できる、スケーラブルで効率的なベースラインを設計すること。
- 人物再識別などの関連タスクにおける提案モデルの汎化可能性を検証すること。
提案手法
- マルチストリームGCNアーキテクチャにおける冗長性を低減するため、ネットワークの初期層でジョイント位置、モーション速度、ボーン特徴を早期に統合する、複数入力ブランチ(MIB)アーキテクチャを導入する。
- GCNに適応された4つの新規時間畳み込み(TC)層(ボトルネック、分離可能、拡張分離可能、砂時計)を採用し、モデルサイズの圧縮と効率の向上を実現する。
- モデル幅と深さを一様にスケーリングするコンパoundスケーリング戦略を適用し、体系的な効率-精度トレードオフを可能にする。
- 情報量の多いジョイントと時間フレームを適応的に強調する空間時間的ジョイントアテンション(ST-JointAtt)モジュールを統合し、パディングや情報のないフレームからのノイズを低減する。
- 分離可能畳み込みを組み込んだ変更版GCNバックボーンを採用し、FLOPsとパラメータ数を削減しながらも、識別能を保持する。
- 体系的な探索により最適な統合段階を検証し、マルチストリームGCNアーキテクチャにおいて早期統合がパラメータ効率性において最も効果的であることを確認した。
実験結果
リサーチクエスチョン
- RQ1骨格に基づく行動認識におけるマルチストリームGCNモデルの最適な統合段階は何か? また、それはモデルの効率性と精度にどのように影響するか?
- RQ2分離可能およびボトルネックスタイルの畳み込みは、性能の損なわれない範囲でGCNに効果的に適応可能か?
- RQ3ジョイント、モーション、ボーン特徴の早期統合は、パラメータ効率性と性能の面で、遅延統合と比べてどのように異なるか?
- RQ4コンパundスケーリングは、GCNベースの骨格認識モデルにおける効率-精度トレードオフをどの程度改善するか?
- RQ5提案されたEfficientGCNベースラインは、行動認識を越えて他の骨格ベースのタスクにも汎化可能か?
主な発見
- EfficientGCN-B4は、NTU RGB+D 60 のクロスサブジェクトベンチマークで92.1%の精度を達成し、すべての先行SOTA手法を上回った。
- MS-G3D(最先端のモデル)よりも5.82倍小さく、5.85倍速く、かつ高い精度を維持した。
- マルチストリームGCNアーキテクチャにおいて、早期統合戦略は遅延統合と比較して、顕著に冗長なパラメータを削減した。
- ST-JointAttモジュールは、特に後段の層で、情報量の多いジョイント(例:手を振る際の腕)を適応的に強調し、情報のないフレームを効果的に抑制した。
- 4つの人物再識別ベンチマークで、EfficientGCN-B4は64.5%、67.3%、62.4%、96.1%のランク-1精度を達成し、すべての先行SOTA手法を上回った。
- 行動認識を越えて、骨格ベースの人物再識別タスクにおいても、優れた汎化性能を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。