Skip to main content
QUICK REVIEW

[論文レビュー] Adversarial Self-Supervised Learning for Semi-Supervised 3D Action Recognition

Chenyang Si, Xuecheng Nie|arXiv (Cornell University)|Jul 12, 2020
Human Pose and Action Recognition参考文献 46被引用数 6
ひとこと要約

本稿では、近傍一貫性正則化と敵対的特徴分布整合化を用いて動き表現学習を強化することで、半教師あり3次元行動認識のための新規フレームワークである敵対的自己教師あり学習(ASSL)を提案する。教師ありデータと教師なしデータの両方で同時に自己教師あり学習を最適化し、教師ありデータと教師なしデータの特徴分布を一致させる敵対的正則化を実行することで、特に低ラベルレジームにおいて最先端の性能を達成し、N-UCLAで15%のラベルのみを用いて74.8%の精度を達成した。

ABSTRACT

We consider the problem of semi-supervised 3D action recognition which has been rarely explored before. Its major challenge lies in how to effectively learn motion representations from unlabeled data. Self-supervised learning (SSL) has been proved very effective at learning representations from unlabeled data in the image domain. However, few effective self-supervised approaches exist for 3D action recognition, and directly applying SSL for semi-supervised learning suffers from misalignment of representations learned from SSL and supervised learning tasks. To address these issues, we present Adversarial Self-Supervised Learning (ASSL), a novel framework that tightly couples SSL and the semi-supervised scheme via neighbor relation exploration and adversarial learning. Specifically, we design an effective SSL scheme to improve the discrimination capability of learned representations for 3D action recognition, through exploring the data relations within a neighborhood. We further propose an adversarial regularization to align the feature distributions of labeled and unlabeled samples. To demonstrate effectiveness of the proposed ASSL in semi-supervised 3D action recognition, we conduct extensive experiments on NTU and N-UCLA datasets. The results confirm its advantageous performance over state-of-the-art semi-supervised methods in the few label regime for 3D action recognition.

研究の動機と目的

  • 半教師あり3次元行動認識において、教師なし3次元スケルトンシーケンスから判別可能な動き表現を学習する課題に対処すること。
  • 自己教師あり学習で学習された表現と教師あり学習からの表現との間の不整合を解消すること。
  • 教師なしデータを効果的に活用することで、低ラベルレジームにおけるモデルの汎化性能を向上させること。
  • 近傍探索と敵対的正則化を通じて、自己教師あり学習と半教師あり学習を密に結合する統一フレームワークを提案すること。

提案手法

  • 局所的近傍内に存在するサンプル間の動き表現の一貫性を強制する近傍一貫性正則化スキームを提案し、クラスレベルの意味的理解を向上させる。
  • 教師なしスケルトンシーケンスから時間的動きパターンを学ぶために自己インパインティングの事前学習タスクを導入する。
  • ドメイン識別器を用いた敵対的訓練を採用し、教師ありと教師なしサンプルの特徴分布を一致させることで、教師ありと自己教師あり表現の間のドメインシフトを低減する。
  • 教師ありデータにおける教師あり学習と、教師なしデータにおける自己教師あり学習を、共同最適化目的関数を通じて統合する。
  • t-SNE可視化を通じて、敵対的整合化後に教師ありおよび教師なしサンプルの特徴がより緊密にクラスタリングされ、クラス間分離性が向上していることを示す。
  • 類似したスケルトンシーケンス間の関係を計算し、一貫性を強制するためにシアン型ネットワークアーキテクチャを採用する。

実験結果

リサーチクエスチョン

  • RQ1近傍に基づく一貫性正則化は、3次元行動認識における自己教師あり動き表現の判別性を向上させることができるか?
  • RQ2教師ありデータと教師なしデータの間で特徴分布を敵対的に整合させることで、表現の不整合を低減し、半教師あり3次元行動認識における汎化性能を向上させることができるか?
  • RQ3低ラベル設定下で、提案されたASSLフレームワークは、既存の半教師ありおよび自己教師あり手法と比較してどの程度有効であるか?
  • RQ4局所的データ関係(近傍)を探索することで、教師なしデータから潜在的な行動意味を推論する能力がどの程度向上するか?

主な発見

  • NTUデータセットでラベルがたった5%の状況下でも、ASSLは57.3%の精度を達成し、教師ありベースラインおよびアブレーションバージョンを顕著に上回った。
  • N-UCLAデータセットで15%のラベルを用いた場合、ASSLは74.8%の精度に達し、低教師ありレジームにおいて優れた性能を示した。
  • アブレーションスタディの結果、全モジュールを統合した場合、N-UCLAで8.4%の性能向上(66.4%から74.8%)が確認された。
  • t-SNE可視化では、敵対的訓練を施したASSLが、教師ありおよび教師なしサンプルの両方でより緊密で分離性の高い特徴クラスタを達成していることが示された。これは、クラス内コンパクト性とクラス間分離性の向上を示している。
  • 訓練の進行に伴い、クラス一貫性を持つ近傍の割合が増加した。これは、近傍探索が潜在的なクラス意味を明らかにするのを支援していることを確認した。
  • 提案手法は、最先端の半教師あり3次元行動認識手法を上回り、NTUおよびN-UCLAの両データセットで新たなSOTA結果を確立した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。