[論文レビュー] Hierarchical Compositional Representations for Few-shot Action Recognition
本論文は、行動を部分行動および空間的注意付き部分行動(SAS行動)に分解することで、微細な、転移可能なパターンを捉える階層的構成表現(HCR)フレームワークを提案する。部分行動の系列同士を地球移動距離(EMD)で比較することで、HMDB51、UCF101、Kineticsデータセットで最先端の性能を達成し、5-way 1-shot設定での正確度は67.5%、88.9%、75.7%であった。
Recently action recognition has received more and more attention for its comprehensive and practical applications in intelligent surveillance and human-computer interaction. However, few-shot action recognition has not been well explored and remains challenging because of data scarcity. In this paper, we propose a novel hierarchical compositional representations (HCR) learning approach for few-shot action recognition. Specifically, we divide a complicated action into several sub-actions by carefully designed hierarchical clustering and further decompose the sub-actions into more fine-grained spatially attentional sub-actions (SAS-actions). Although there exist large differences between base classes and novel classes, they can share similar patterns in sub-actions or SAS-actions. Furthermore, we adopt the Earth Mover's Distance in the transportation problem to measure the similarity between video samples in terms of sub-action representations. It computes the optimal matching flows between sub-actions as distance metric, which is favorable for comparing fine-grained patterns. Extensive experiments show our method achieves the state-of-the-art results on HMDB51, UCF101 and Kinetics datasets.
研究の動機と目的
- データ不足と複雑な時間的ダイナミクスによる少データ行動認識の課題に対処する。
- 従来手法のグローバルな動画プーリングや硬直的なクリップ同期の制限を克服する。
- 共通する微細なパターンを発見することで、ベースクラスからノベルクラスへの識別的知識の転移を可能にする。
- より良い表現学習のため、行動を部分行動および空間的注意付き部分行動(SAS行動)に階層的に分解する。
- 微細な部分行動系列同士の比較に耐性のある指標として、地球移動距離(EMD)を導入する。
提案手法
- 複雑な行動を時間的に一貫性のある部分行動に分解するため、階層的クラスタリングを適用する。
- 空間的注意付き部分行動(SAS行動)を抽出するためのパーツ注意モジュール(PAM)を設計し、明示的(身体部位)および暗黙的(文脈的情報)な要素を区別する。
- 事前に定義された身体部位に注目を誘導するパーツ事前制約を導入し、関連する運動パターンの局在化を向上させる。
- 各動画を部分行動およびSAS行動埋め込みの系列として表現し、微細な比較を可能にする。
- 部分行動系列間の最適輸送フローを計算するために地球移動距離(EMD)を用い、頑健な類似度測定を実現する。
- EMD空間における類内距離の最小化と類間距離の最大化を目的関数とするメトリック学習によりモデルを訓練する。
実験結果
リサーチクエスチョン
- RQ1部分行動およびSAS行動への階層的分解により、転移可能な微細なパターンを捉えることで、少データ行動認識の性能が向上するか?
- RQ2少データ行動認識における動画表現の比較において、地球移動距離(EMD)は、コサイン距離やユークリッド距離といった従来の指標を上回るか?
- RQ3注意によって学習された明示的および暗黙的SAS行動は、身体部位と文脈的情報を効果的にモデル化し、一般化性能を向上させるか?
- RQ4部分行動の数が認識性能に与える影響は何か?また、細分化の粒度と冗長性の最適なトレードオフは何か?
- RQ5大規模な動画データセット(例:IG-65M)での事前学習は、低データ環境における少データ一般化性能をどの程度向上させるか?
主な発見
- 提案されたHCR手法は、5-way 1-shot設定においてHMDB51で67.5%の最先端の正確度を達成した。
- UCF101では、5-way 1-shotベンチマークで88.9%の正確度に達し、先行手法を上回った。
- Kineticsでは、5-way 1-shot設定で75.7%の正確度を達成し、多様な行動クラスにわたる強力な一般化性能を示した。
- 最適な部分行動の数は、HMDB51で12、UCF101で16、Kineticsで24であり、各データセットに応じた粒度のトレードオフが示された。
- 地球移動距離(EMD)は、ユークリッド距離およびコサイン距離を顕著に上回り、動画表現間の類似度測定において優れた性能を示した。
- 平均プーリング(AvgPool)は最大プーリング(MaxPool)よりも優れた性能を示し、判別力の低い特徴を保持することで少データ一般化性能が向上することが示唆された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。