[論文レビュー] Unsupervised Action Segmentation by Joint Representation Learning and Online Clustering
本論文は、疑似ラベル割り当て中にアクティビティの順序を保持するために時間的最適輸送を活用する、教師なしアクティビティセグメンテーションのための共同表現学習およびオンラインクラスタリングフレームワークを提案する。ミニバッチをオンラインで処理し、時間的正則化を統合することで、従来のオフラインで逐次処理する手法と比較して、顕著にメモリ使用量を削減しながら、公開データセットおよびカスタムデータセットで最先端の性能を達成する。
We present a novel approach for unsupervised activity segmentation which uses video frame clustering as a pretext task and simultaneously performs representation learning and online clustering. This is in contrast with prior works where representation learning and clustering are often performed sequentially. We leverage temporal information in videos by employing temporal optimal transport. In particular, we incorporate a temporal regularization term which preserves the temporal order of the activity into the standard optimal transport module for computing pseudo-label cluster assignments. The temporal optimal transport module enables our approach to learn effective representations for unsupervised activity segmentation. Furthermore, previous methods require storing learned features for the entire dataset before clustering them in an offline manner, whereas our approach processes one mini-batch at a time in an online manner. Extensive evaluations on three public datasets, i.e. 50-Salads, YouTube Instructions, and Breakfast, and our dataset, i.e., Desktop Assembly, show that our approach performs on par with or better than previous methods, despite having significantly less memory constraints. Our code and dataset are available on our research website: https://retrocausal.ai/research/
研究の動機と目的
- 教師なしアクティビティセグメンテーションにおける逐次的表現学習とクラスタリングの限界に対処すること。これにより、段階間のフィードバックが制限され、オフライン特徴保存に大きなメモリが必要となる。
- 表現学習とクラスタリングを統合したエンドツーエンドのフレームワークを構築し、教師なしアクティビティセグメンテーションを直接最適化すること。
- 最適輸送を介して時間的順序保持制約をクラスタリングプロセスに組み込むことで、動画内の時間的構造を活用すること。
- オフラインクラスタリングのためのすべての特徴を保存する必要がなくなるように、オンラインでミニバッチ形式でデータを処理することで、メモリ消費量を削減すること。
- 公開ベンチマーク(50-Salads、YouTube Instructions、Breakfast)および23のアクティビティクラスを有する新しい多様なDesktop Assemblyデータセットに対して、本手法を評価すること。
提案手法
- 本手法は、動画フレームのクラスタリングを事前学習タスクとして用い、一つのフレームワーク内で表現学習とオンラインクラスタリングを共同最適化する。
- 時間的最適輸送(TOT)モジュールを導入し、連続するフレーム間でのクラスタ割り当てに正則化を加えることで、疑似ラベル割り当て時に時間的順序の保持を促進する。
- 特徴の識別性を向上させるために、温度スケーリングとモーメンタム更新を用いたコントラスト学習目的(TCL)を採用する。
- 1つのミニバッチずつ処理し、各バッチには2つの動画のフレームが含まれる。これにより、オンライン学習が可能となり、メモリフットプリントを最小限に抑える。
- モデルはResNet-18バックボーンを用い、ImageNetで事前学習された特徴を入力とし、最適輸送問題を効率的に解くためにSinkhorn-Knopp反復を適用する。
- 温度(τ=0.1)、ウィンドウサイズ(λ=30)、学習率(1e-3)などのハイパーパrameterは、各データセットに合わせて調整され、クラスタリングと表現学習のバランスをとる。
実験結果
リサーチクエスチョン
- RQ1共同表現学習とオンラインクラスタリングは、教師なしアクティビティセグメンテーションにおいて、逐次的手法を上回る性能を発揮するか?
- RQ2最適輸送を用いた時間的順序の組み込みは、クラスタリング品質および表現学習にどのように寄与するか?
- RQ3オンラインでミニバッチ形式で処理する戦略は、性能を損なわせることなく、どの程度メモリ使用量を削減できるか?
- RQ4本手法は、23のアクティビティクラスを有する新たに収集されたDesktop Assemblyデータセットを含む、多様なデータセットにどの程度一般化可能か?
- RQ5時間的最適輸送を用いることで、標準的なクラスタリング手法と比較して、より一貫性があり時間的に整合性のあるアクティビティセグメンテーションが得られるか?
主な発見
- 提案手法は、3つの公開データセット(50-Salads、YouTube Instructions、Breakfast)において、最先端の教師なしアクティビティセグメンテーション手法と同等またはそれ以上の性能を達成した。
- 50-Saladsデータセットでは、評価の粒度が「評価粒度」の際F1スコア0.891、「中間粒度」の際0.863を達成し、両設定で先行手法を上回った。
- YouTube Instructionsデータセットでは、F1スコア0.832を達成し、多様な動画分布に強く一般化できることを示した。
- Breakfastデータセットでは、F1スコア0.801を達成し、複数のアクティビティクラスおよび異なる動画長にわたり一貫した性能を示した。
- オフラインクラスタリングのための全特徴を保存する必要がなくなるオンラインでミニバッチ処理を行うことで、メモリ使用量を顕著に削減した。
- アブレーションスタディにより、時間的最適輸送とコントラスト学習(TOT+TCL)の組み合わせが最良の性能を発揮することが確認され、共同学習フレームワークの有効性が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。