Skip to main content
QUICK REVIEW

[論文レビュー] Topology-aware Convolutional Neural Network for Efficient Skeleton-based Action Recognition

Kailin Xu, Fanfan Ye|arXiv (Cornell University)|Dec 8, 2021
Human Pose and Action Recognition被引用数 10
ひとこと要約

本稿では、新しいクロスチャネル特徴拡張モジュールとカスタムのSkeletonMixデータ拡張戦略を用いて、トポロジー特徴の学習を強化する純粋な畳み込みニューラルネットワークであるTopology-aware CNN (Ta-CNN) を提案する。この手法は、CNNおよびGCNベースのモデルと比較して、顕著に少ないパラメータ数とGFLOPsで最先端の精度を達成した。

ABSTRACT

In the context of skeleton-based action recognition, graph convolutional networks (GCNs) have been rapidly developed, whereas convolutional neural networks (CNNs) have received less attention. One reason is that CNNs are considered poor in modeling the irregular skeleton topology. To alleviate this limitation, we propose a pure CNN architecture named Topology-aware CNN (Ta-CNN) in this paper. In particular, we develop a novel cross-channel feature augmentation module, which is a combo of map-attend-group-map operations. By applying the module to the coordinate level and the joint level subsequently, the topology feature is effectively enhanced. Notably, we theoretically prove that graph convolution is a special case of normal convolution when the joint dimension is treated as channels. This confirms that the topology modeling power of GCNs can also be implemented by using a CNN. Moreover, we creatively design a SkeletonMix strategy which mixes two persons in a unique manner and further boosts the performance. Extensive experiments are conducted on four widely used datasets, i.e. N-UCLA, SBU, NTU RGB+D and NTU RGB+D 120 to verify the effectiveness of Ta-CNN. We surpass existing CNN-based methods significantly. Compared with leading GCN-based methods, we achieve comparable performance with much less complexity in terms of the required GFLOPs and parameters.

研究の動機と目的

  • 不規則なスケルトントポロジーをモデル化する能力に欠けるCNNの限界を是正し、GCNに比べてその利用が制限されてきた問題に対処すること。
  • 関節をチャネルとして扱うと、グラフ畳み込みが標準畳み込みの特殊ケースであることを示し、CNNがトポロジーを効果的にモデル化できることを示すこと。
  • GCNベースの手法と同等の性能を達成しながら、計算コストを抑えた軽量な純粋なCNNアーキテクチャを設計すること。
  • スケルトンシーケンスに特化した新しいデータ拡張戦略、SkeletonMixを導入し、汎化性能とロバスト性を向上させること。

提案手法

  • マップ・アテンション・グループ・マップの操作を組み合わせたクロスチャネル特徴拡張モジュールを提案し、座標特徴と関節特徴を強化する。
  • 座標に配慮したグルーピング(CAG)モジュールを導入し、特徴マッピング、チャネルアテンション、二重の座標方向畳み込みを適用して関節間の相互作用をモデル化する。
  • ボディパーツの意味的セマンティクスに基づいて特徴をグルーピングする、バーチャルパーツに配慮したグルーピング(VAG)モジュールを設計し、トポロジーをさらに活用する。
  • 理論的に、関節次元をチャネルとして扱う場合、グラフ畳み込みが標準畳み込みの特殊ケースであることを証明し、CNNによるトポロジカルモデリングの正当性を裏付ける。
  • 2人の異なる人物の上半身と下半身を混合するモダリティに配慮した方法で訓練データを拡張する、新規のSkeletonMix戦略を開発する。
  • スケルトンシーケンスとモーション情報を処理する2ストリームアーキテクチャを採用し、特徴のラテントフェージョンにより表現学習を向上させる。

実験結果

リサーチクエスチョン

  • RQ1純粋なCNNモデルは、人間のスケルトンデータの不規則なトポロジカル構造を効果的に学習・活用できるか?
  • RQ2関節をチャネルとして扱う場合、グラフ畳み込みと標準畳み込みの間に理論的同等性が存在するか?
  • RQ3隣接行列に依存せずに、クロスチャネル特徴拡張機構がCNNにおけるトポロジーモデリングを向上させられるか?
  • RQ4SkeletonMixのようなモダリティ固有のデータ拡張戦略は、スケルトンベースの行動認識における汎化性能と性能向上に寄与するか?
  • RQ5軽量なCNNベースのモデルは、重いGCNベースのモデルと同等の性能を達成しつつ、モデルの複雑さを顕著に低減できるか?

主な発見

  • N-UCLAデータセットにおいて、Ta-CNNは97.2%の最先端精度を達成し、すべての先行CNNベースの手法を上回り、最良のGCNベースのモデルと同等またはそれを上回った。
  • SBUデータセットでは98.9%の精度を達成し、新たなSOTAを樹立。モデルサイズは従来の手法と比べて顕著に小さい。
  • NTU RGB+Dではクロスサブジェクト設定で90.4%のトップ1精度を達成し、すべての既存のCNNベースの手法を上回り、FLOPsとパラメータ数が少ないにもかかわらず、トップのGCNベースのモデルと同等の性能を示した。
  • NTU RGB+D 120ではクロスサブジェクト設定で85.7%の精度を達成し、特に重いGCNベースのベースラインと比較して、優れた汎化性能と効率性を示した。
  • 提案されたSkeletonMix戦略は、すべてのデータセットで性能向上をもたらしたが、ヴァリエーションのmixupは性能を低下させたため、その有効性とモダリティ特化された設計の妥当性が裏付けられた。
  • 理論的分析により、関節次元をチャネルとして扱う場合、グラフ畳み込みが標準畳み込みの特殊ケースであることが確認され、CNNベースのトポロジカルモデリングの基盤が確立された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。