Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Motion Representation Learning with Capsule Autoencoders

Ziwei Xu, Xudong Shen|arXiv (Cornell University)|Oct 1, 2021
Human Pose and Action Recognition参考文献 59被引用数 10
ひとこと要約

本稿では、スニペットとセグメントの2段階の階層を持つ、変換不変な動き表現を教師なしで学習するキャプセルベースのフレームワーク、Motion Capsule Autoencoder (MCAE) を提案する。局所的な動きスニペットをモデル化し、ポーズ不変なテンプレートを用いてそれらを統合することで、より高レベルの意味的セグメントを形成する。MCAE は、新しい合成データセット(Trajectory20)と実世界のベンチマークで検証された結果、パrameter数を減らしながらも、教師なし骨格ベースの行動認識で最先端の性能を達成する。

ABSTRACT

We propose the Motion Capsule Autoencoder (MCAE), which addresses a key challenge in the unsupervised learning of motion representations: transformation invariance. MCAE models motion in a two-level hierarchy. In the lower level, a spatio-temporal motion signal is divided into short, local, and semantic-agnostic snippets. In the higher level, the snippets are aggregated to form full-length semantic-aware segments. For both levels, we represent motion with a set of learned transformation invariant templates and the corresponding geometric transformations by using capsule autoencoders of a novel design. This leads to a robust and efficient encoding of viewpoint changes. MCAE is evaluated on a novel Trajectory20 motion dataset and various real-world skeleton-based human action datasets. Notably, it achieves better results than baselines on Trajectory20 with considerably fewer parameters and state-of-the-art performance on the unsupervised skeleton-based action recognition task.

研究の動機と目的

  • 視点変化や被験者に依存する変化がある状況下でも、教師なし設定において変換不変な動き表現を学習するという課題に取り組むこと。
  • 局所的な短時間の動きと、グローバルな長期間の意味的パターンを両方捉える階層的動き表現フレームワークを構築すること。
  • スニペットテンプレートから学習されたテンプレートを用いてセグメントテンプレートをパラメータ化することで、モデルの複雑さを低減しながらも、識別力の維持を図ること。
  • 合成データセットと実世界の骨格ベースの行動認識データセットの両方でフレームワークを評価し、耐障害性と一般化性能を示すこと。

提案手法

  • MCAE は2段階のキャプセル階層を採用する:スニペットキャプセル(SniCap)は局所的で短時間の動き信号を処理し、セグメントキャプセル(SegCap)はより長い期間で意味的に意味のある動きセグメントを処理する。
  • 各キャプセルは、学習済みのテンプレート(SniCap では動き系列、SegCap では SniCap テンプレートの組み合わせ)を保持し、入力動きを再構築するために幾何的変換パラメータを学習する。
  • 意味的コンテンツ(キャプセル活性化 ν に符号化)と幾何的変換(変換パラメータ B に符号化)を分離することで、変換不変性を達成する。
  • 注目ベースルーティングと正則化された訓練を用いた、新しいキャプセルオートエンコーダ設計により、ポーズ不変特徴の学習を安定化させる。
  • セグメントキャプセルはスニペットキャプセルから階層的に構築され、パrameter数を削減しながらも階層的抽象化を維持する。
  • クラス内変動を制御した状況下での動き表現の耐障害性を評価するため、新しい合成データセット Trajectory20 を導入する。

実験結果

リサーチクエスチョン

  • RQ1キャプセルベースのオートエンコーダは、教師なし設定で視点変化や被験者固有の変化に対して不変な動き表現を学習できるか?
  • RQ22段階のスニペット・セグメントキャプセル階層は、局所的な動きダイナミクスとグローバルな意味的動きパターンの両方を効果的に捉えられるか?
  • RQ3意味的コンテンツ(ν)と幾何的変換(B)の分離は、動き変換に対する耐障害性をどの程度向上させるか?
  • RQ4実世界の骨格ベースの行動認識において、MCAE は既存の教師なし手法と比較して、正確性、パラメータ効率、一般化性能の点で優れているか?
  • RQ5提案されたフレームワークは、多様な動きパターンに一般化可能であり、クラス内変動(並進・回転)を制御した条件下でも耐障害性を保っているか?

主な発見

  • MCAE は、教師なし骨格ベースの行動認識ベンチマークで最先端の性能を達成し、既存のベースラインを上回る。
  • 新規の Trajectory20 データセットでは、競合手法と比較して顕著に少ないパラメータ数で優れた結果を達成した。
  • アブレーションスタディにより、意味的コンテンツ(ν)と変換パラメータ(B)の分離が、安定的で変換に強い表現をもたらすことが確認された。
  • 並進・回転の制御されたクラス内変動がある動きパターンに対しても、フレームワークは一貫した性能を示した。
  • MCAE が学習したセグメントテンプレートは、入力の並進に伴い空間的位置に単調なシフトを示し、意味的コンテンツが幾何的変換に対して不変であることを裏付けた。
  • MCAE は、大きな視点変化や動きの摂動に対しても、高い再構築精度と安定した活性化パターンを維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。