Skip to main content
QUICK REVIEW

[論文レビュー] Iterate & Cluster: Iterative Semi-Supervised Action Recognition.

Jingyuan Li, Eli Shlizerman|arXiv (Cornell University)|Jun 12, 2020
Human Pose and Action Recognition参考文献 21被引用数 7
ひとこと要約

本稿では、潜在空間における自己符号化器ベースのクラスタリングを活用し、注釈に最も情報をもたらす動画シーケンスを能動的に選択することで、注釈コストを低減する、アクティブラーニングに基づく反復的で新しい半教師付きフレームワーク「Iterate & Cluster」を提案する。少ない数の人的ラベルを用いてクラスタ-アクションの関連性を反復的に精緻化することで、NW-UCLA や UWA3D といったスケルトンベースのアクション認識ベンチマーク、およびマウスの動きに関するデータセットにおいて、SOTA の性能を達成した。ラベルの 5% のみで 20% 以上の性能向上を実現した。

ABSTRACT

We propose a novel system for active semi-supervised feature-based action recognition. Given time sequences of features tracked during movements our system clusters the sequences into actions. Our system is based on encoder-decoder unsupervised methods shown to perform clustering by self-organization of their latent representation through the auto-regression task. These methods were tested on human action recognition benchmarks and outperformed non-feature based unsupervised methods and achieved comparable accuracy to skeleton-based supervised methods. However, such methods rely on K-Nearest Neighbours (KNN) associating sequences to actions, and general features with no annotated data would correspond to approximate clusters which could be further enhanced. Our system proposes an iterative semi-supervised method to address this challenge and to actively learn the association of clusters and actions. The method utilizes latent space embedding and clustering of the unsupervised encoder-decoder to guide the selection of sequences to be annotated in each iteration. Each iteration, the selection aims to enhance action recognition accuracy while choosing a small number of sequences for annotation. We test the approach on human skeleton-based action recognition benchmarks assuming that only annotations chosen by our method are available and on mouse movements videos recorded in lab experiments. We show that our system can boost recognition performance with only a small percentage of annotations. The system can be used as an interactive annotation tool to guide labeling efforts for 'in the wild' videos of various objects and actions to reach robust recognition.

研究の動機と目的

  • アクション認識における高い注釈コストの課題に対処し、人的ラベルが必要なシーケンス数を最小限に抑える。
  • KNN に依存する無教師クラスタリング手法の限界を克服し、教師なし条件下で最適でないクラスタ-アクションの関連付けを避ける。
  • 潜在空間の埋め込みとクラスタ構造に基づいて、最も情報をもたらすシーケンスを知的に選択するアクティブラーニング戦略を開発する。
  • 人間のスケルトンシーケンスやマウスの動きの動画を含む多様なデータセットにおいて、低監視環境下でも堅牢な性能を示すことを実証する。

提案手法

  • 時間的シーケンス表現を学習し、潜在状態を自己組織化してアクションクラスタに分類する、無教師の自己符号化器ベースのエンコーダ-デコーダモデルを活用する。
  • 学習された潜在空間におけるクラスタリングを適用し、いかなる真値ラベルも不要に、類似したアクションシーケンスをグループ化する。
  • 潜在空間における不確実性と多様性に基づき、クラスタ構造を指針として、注釈に適したシーケンスを選択するアクティブラーニング戦略を設計する。
  • 新たにラベル付けされたシーケンスを統合することで、各イテレーションにおいてクラスタ-アクション関連性を反復的に精緻化し、モデルを更新して再クラスタリングする。
  • 選択戦略の違いにより、IC-KR、IC-KT、IC-KEP の3つのバリエーションを導入:それぞれK近傍法ベース、不確実性ベース、および両者のハイブリッド。
  • 選択されたラベル付きシーケンスのみを用いて最終的な分類器を訓練し、注釈予算が極めて少ない状況でも高い精度を達成する。

実験結果

リサーチクエスチョン

  • RQ1無教師の自己符号化器ベースのクラスタリング手法をアクティブラーニングと効果的に組み合わせることで、アクション認識における注釈コストを低減できるか?
  • RQ2潜在空間の埋め込みとクラスタ構造に基づく選択戦略は、ランダム選択やKNNベースのラベル付けに比べ、1ラベルあたりの精度向上にどの程度優れているか?
  • RQ3少数のデータしかラベル付けされていない状況で、クラスタ-アクション関連性の反復的精緻化が認識性能にどの程度寄与するか?
  • RQ4本手法は、人間の被験者だけでなく、マウスのような非人間の被験者を含む多様なアクション認識データセットに一般化可能か?

主な発見

  • NW-UCLA データセットでは、5% のデータにラベルを付与したのみで、IC-KEP は 72.2% の精度を達成し、ベースラインのKNN手法(52.0%)に対して 20.2% の向上を示した。
  • UWA3D データセットでは、100% のラベルを用いて IC-KEP は 95.3% の精度を達成し、C-EP アクティブラーニング手法(95.8%)を上回り、限られたラベルでも堅牢な性能を示した。
  • マウスデータセットでは、IC-KEP は 5% のラベル予算で 28.9% の精度を達成し、KNN(18.7%)や他のベースラインを大きく上回った。
  • 初期イテレーションで急速な性能向上を示し、特にラベル予算が小さい場合(例:5% や 20%)に、C や C-EP に対して IC-KEP が顕著な性能差を開けた。
  • C-EP の性能は、埋め込み空間におけるラベルの分布に極めて敏感であったが、IC-KEP は構造的な選択戦略により一貫した向上を示した。
  • 100% の完全な注釈を用いても、IC-KEP はSOTAの教師ありベースラインと同等またはそれを上回り、反復的アクティブラーニングプロセスがモデルの一般化性能を向上させることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。