Skip to main content
QUICK REVIEW

[論文レビュー] TransRAC: Encoding Multi-scale Temporal Correlation with Transformers for Repetitive Action Counting

Huazhang Hu, Sixun Dong|arXiv (Cornell University)|Apr 3, 2022
Human Pose and Action Recognition被引用数 4
ひとこと要約

本論文では、繰り返し動作のカウントを改善するためのトランスフォーマー基盤手法であるTransRACを提案する。本手法は、長時間で現実的であるが遮断や不規則なサイクルを伴う動画においても、マルチスケールの時間的相関を符号化することで性能を向上させる。また、詳細なサイクルアノテーションを備えた新たな大規模データセットRepCountを導入し、解釈可能な周期予測のための密度マップ回帰を用いる。この手法は、さまざまなデータセットで最先端の結果を達成しており、未学習のデータに対してもゼロショット一般化を実現する。

ABSTRACT

Counting repetitive actions are widely seen in human activities such as physical exercise. Existing methods focus on performing repetitive action counting in short videos, which is tough for dealing with longer videos in more realistic scenarios. In the data-driven era, the degradation of such generalization capability is mainly attributed to the lack of long video datasets. To complement this margin, we introduce a new large-scale repetitive action counting dataset covering a wide variety of video lengths, along with more realistic situations where action interruption or action inconsistencies occur in the video. Besides, we also provide a fine-grained annotation of the action cycles instead of just counting annotation along with a numerical value. Such a dataset contains 1,451 videos with about 20,000 annotations, which is more challenging. For repetitive action counting towards more realistic scenarios, we further propose encoding multi-scale temporal correlation with transformers that can take into account both performance and efficiency. Furthermore, with the help of fine-grained annotation of action cycles, we propose a density map regression-based method to predict the action period, which yields better performance with sufficient interpretability. Our proposed method outperforms state-of-the-art methods on all datasets and also achieves better performance on the unseen dataset without fine-tuning. The dataset and code are available.

研究の動機と目的

  • 長時間で現実的であるが遮断や不規則な動作サイクルを伴う動画において、従来の繰り返し動作カウント手法の限界を克服すること。
  • 数値カウントのみではなく、サイクルレベルの詳細なアノテーションを導入することで、より解釈可能で正確なモデルの構築を図ること。
  • 多様な動画長さと異常をカバーする、大規模で現実的なデータセット(RepCount)を構築し、モデルの評価と学習をより良くすること。
  • トランスフォーマーを用いたマルチスケール時間的相関を活用することで、モデルの性能と効率のバランスを取ること。
  • 向上した時間的モデリングとアーキテクチャ設計により、微調整なしに未学習のデータセットへ一般化できるようにすること。

提案手法

  • 本手法は、自己注意メカニズムを用いたマルチスケール時間的相関エンコーダを採用し、異なる時間スケール間の長距離依存関係をモデル化する。
  • 行動周期の予測を可能にするために、密度マップ回帰ヘッドを導入し、従来の分類ヘッドと比較して、繰り返しサイクルの局所化がより解釈可能で正確になる。
  • 異なる受容 field を持つマルチカラムアーキテクチャを用いて、さまざまなスケールでの時間的パターンを捉え、特徴を統合することで、より高いロバスト性を実現する。
  • 自己注意メカニズムは相関行列を動的に計算し、TSM(時間的自己類似性行列)のような固定類似度関数を上回る性能を発揮する。
  • 本アーキテクチャは、1,451本の動画と約20,000件の詳細なサイクルアノテーションを含むRepCountデータセット上で、エンド・ツー・エンドに訓練される。
  • 本手法は、MAE(平均絶対誤差)とOBO(全体最良オーバーラップ)の指標を用いて評価され、優れた性能とゼロショット一般化能力を示している。

実験結果

リサーチクエスチョン

  • RQ1トランスフォーマー基盤のモデルは、繰り返し動作カウントのための長時間で現実的な動画において、マルチスケールの時間的相関を効果的に捉えられるか?
  • RQ2数値カウントのみではなく、サイクルレベルの詳細なアノテーションを導入することで、モデルの解釈性と性能が向上するか?
  • RQ3密度マップ回帰ヘッドは、繰り返し動作の周期予測において、従来の分類ヘッドを上回る性能を発揮するか?
  • RQ4マルチスケールモデリングは、動作の遮断や不規則なサイクルが存在する状況でも、性能とロバスト性を向上させるか?
  • RQ5提案手法は、微調整なしに未学習のデータセットへ一般化可能であり、より優れた一般化能力を示しているか?

主な発見

  • TransRACは、RepCount part-AテストセットにおいてMAE 0.4431、OBO 0.2913を達成し、最先端の手法を上回る性能を示した。
  • 相関行列の計算に自己注意を用いることで、TSMベースの類似度関数を上回り、MAEが0.1247低下した。
  • 分類ヘッドを密度マップレグレッサーに置き換えることで、性能が顕著に向上し、MAEはResNet+CLSの0.9950からResNet+DMの0.6905に低下した。
  • マルチスケールモデリング(Ours (Multi))は、最良の性能(MAE: 0.4431)を達成し、単一スケールの変種を上回った。
  • 微調整なしに未学習のデータセットへも良好に一般化でき、強力なゼロショット一般化能力を示した。
  • 提案されたRepCountデータセット(1,451本の動画と約20,000件の詳細なサイクルアノテーション)は、繰り返し動作カウントのためのより現実的で挑戦的なベンチマークを提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。