Skip to main content
QUICK REVIEW

[論文レビュー] Context-aware and Scale-insensitive Temporal Repetition Counting

Huaidong Zhang, Xuemiao Xu|arXiv (Cornell University)|May 18, 2020
Human Pose and Action Recognition参考文献 35被引用数 4
ひとこと要約

本論文は、現実世界の反復的行動における変動するサイクル長に対応する、文脈に配慮したかつスケールに敏感でない時系列反復回数カウントのフレームワークを提案する。複数の時間スケールにわたる精度を向上させるために、二重サイクル入力を用いた前向き・後向き回帰ネットワークを用いた粗くから細かくまでの精錬戦略を採用し、UCFRepデータセット(526本の動画を含む)を含む複数のベンチマークで最先端の性能を達成した。

ABSTRACT

Temporal repetition counting aims to estimate the number of cycles of a given repetitive action. Existing deep learning methods assume repetitive actions are performed in a fixed time-scale, which is invalid for the complex repetitive actions in real life. In this paper, we tailor a context-aware and scale-insensitive framework, to tackle the challenges in repetition counting caused by the unknown and diverse cycle-lengths. Our approach combines two key insights: (1) Cycle lengths from different actions are unpredictable that require large-scale searching, but, once a coarse cycle length is determined, the variety between repetitions can be overcome by regression. (2) Determining the cycle length cannot only rely on a short fragment of video but a contextual understanding. The first point is implemented by a coarse-to-fine cycle refinement method. It avoids the heavy computation of exhaustively searching all the cycle lengths in the video, and, instead, it propagates the coarse prediction for further refinement in a hierarchical manner. We secondly propose a bidirectional cycle length estimation method for a context-aware prediction. It is a regression network that takes two consecutive coarse cycles as input, and predicts the locations of the previous and next repetitive cycles. To benefit the training and evaluation of temporal repetition counting area, we construct a new and largest benchmark, which contains 526 videos with diverse repetitive actions. Extensive experiments show that the proposed network trained on a single dataset outperforms state-of-the-art methods on several benchmarks, indicating that the proposed framework is general enough to capture repetition patterns across domains.

研究の動機と目的

  • 現実世界の反復的行動における変動的かつ予測不能なサイクル長の課題に対処すること。既存の手法は固定された時間スケールの仮定に基づくため、この課題に対処できない。
  • 孤立したセグメントに依存するのではなく、複数の行動サイクルにわたる文脈的理解を統合することで、反復回数カウントの精度を向上させること。
  • 全範囲のグローバルサーチに代えて、階層的で粗くから細かくまでの精錬戦略を用いることで、サイクル長探索における計算コストを低減すること。
  • 今後の研究を支援するための、時系列反復回数カウントのための新しい大規模ベンチマークを確立すること。
  • 1つのデータセットで学習したモデルが、異なるベンチマークや行動クラスにわたって一般化できることを示すこと。

提案手法

  • 粗くから細かくまでのサイクル精錬戦略を提案。初期のサイクル長推定はローカルな動画クリップで行われ、その後、全動画にわたって伝搬され、精錬されることで計算コストを低減する。
  • 前向き・後向き回帰ネットワークは、2つの連続する行動サイクル(二重サイクル)を入力とし、直前の反復および次の反復の位置を予測することで、文脈に配慮した推定を可能にする。
  • ネットワークは、広範な時間スケールにわたるサイクル長を予測するためのマルチアンカー回帰ヘッドを用いることで、多様なサイクル変動に対する耐性を高める。
  • 過去および未来の反復からの文脈特徴を統合することで、交互に動く腕の動きのような類似した部分運動を示す行動における誤計数を回避する。
  • UCF101から526本の動画をアノテートして、反復回数カウントのためのトレーニングおよび評価を支援する新しいベンチマークUCFRepを構築した。
  • 本手法はエンドツーエンドで学習され、QUVA RepetitionおよびYTsegmentsを含む複数のデータセットでMAEおよびOBOA指標を用いて評価された。

実験結果

リサーチクエスチョン

  • RQ1粗くから細かくまでの精錬戦略は、変動する反復的行動におけるサイクル長推定において、計算コストを低減しつつも精度を維持できるか?
  • RQ22つの連続する反復からの前向き・後向きの文脈を組み込むことで、単一シーケンスモデルと比較して、サイクル長予測がどの程度向上するか?
  • RQ3マルチアンカー回帰は、多様で予測不能なサイクル長に対して、どの程度耐性を高めるか?
  • RQ41つのデータセットで学習したモデルは、異なるベンチマークや行動クラスにわたって、どの程度一般化できるか?
  • RQ5本フレームワークは、1x、2x、4xのサイクル長変化といった異なる時間スケールにおいて、どの程度の性能を示すか?

主な発見

  • 提案手法はUCFRepの検証セットで平均絶対誤差(MAE)0.147 ± 0.243を達成し、以前の最先端手法を上回った。
  • アブレーションスタディの結果、二重時間スケール(Free)とマルチアンカー(mAnchor)を組み合わせた場合が最良の性能(MAE: 0.147 ± 0.243、OBOA: 0.79)を示し、文脈情報とマルチスケール予測の有効性を確認した。
  • 粗くから細かくまでの精錬プロセスは各段階で精度を向上させ、段階5(74イテレーション)が速度と性能の最適なトレードオフとして選択された。
  • モデルは行動クラスにわたって良好に一般化しており、MAEの標準偏差が低く(全体で0.243、Bikingでは0.062)、クラス固有の変動に対して耐性があることを示した。
  • 4xサイクル長変化において8.0%のOBOAを達成し、多様な時間スケールにわたる強力なスケール不変性を示した。
  • QUVA RepetitionおよびYTsegmentsを含む3つのベンチマークで、最先端の手法を上回った。これは、一般化能力の有効性を確認するものである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。