[論文レビュー] Few-Shot Action Recognition with Compromised Metric via Optimal Transport
本稿では、最適輸送を用いたコンpromィズドメトリック(CMOT)を提案する。これは、最適輸送を用いてセマンティックな内容と時間的順序を同時にモデル化することで、少数ショット行動認識のための新しいメトリック学習フレームワークである。動画同士の比較をセグメント列の間の最適輸送問題として定式化し、位置の不一致をペナルティ化することで、UCF-101、HMDB-51、SMSM-V2で最先端の性能を達成し、コンテンツに敏感なタスクと順序に敏感なタスクの両方をバランスさせる。
Although vital to computer vision systems, few-shot action recognition is still not mature despite the wide research of few-shot image classification. Popular few-shot learning algorithms extract a transferable embedding from seen classes and reuse it on unseen classes by constructing a metric-based classifier. One main obstacle to applying these algorithms in action recognition is the complex structure of videos. Some existing solutions sample frames from a video and aggregate their embeddings to form a video-level representation, neglecting important temporal relations. Others perform an explicit sequence matching between two videos and define their distance as matching cost, imposing too strong restrictions on sequence ordering. In this paper, we propose Compromised Metric via Optimal Transport (CMOT) to combine the advantages of these two solutions. CMOT simultaneously considers semantic and temporal information in videos under Optimal Transport framework, and is discriminative for both content-sensitive and ordering-sensitive tasks. In detail, given two videos, we sample segments from them and cast the calculation of their distance as an optimal transport problem between two segment sequences. To preserve the inherent temporal ordering information, we additionally amend the ground cost matrix by penalizing it with the positional distance between a pair of segments. Empirical results on benchmark datasets demonstrate the superiority of CMOT.
研究の動機と目的
- 集約ベースの手法が時間的順序を無視するか、マッチングベースの手法が序列の一致を厳密に制限するという、従来の少数ショット行動認識手法の限界を是正すること。
- 動画内のセマンティックな内容と時間的構造の両方を同時に捉える統一されたメトリック学習フレームワークの開発。
- 例えば「押す」と「引く」のようなコンテンツに敏感な行動や、「左から右へ」と「右から左へ」といった順序に敏感な行動の両方に対して、識別性能をバランスさせる。
- 事前学習済み3D畳み込みニューラルネットワーク(C3D)と最適輸送を活用して、動画レベルの距離を計算することで、効果的な少数ショット一般化を実現すること。
提案手法
- 各動画からM=4個の均等なセグメントを抽出し、それぞれが16フレームの連続フレームから構成される。その後、事前学習済みC3Dネットワークを用いて各セグメントの埋め込み表現を抽出する。
- 2つの動画間の距離を、セグメント列の間の最適輸送問題として定式化し、セマンティックコストと位置コストを組み合わせた融合コスト行列を用いる。
- セグメント埋め込み表現間のL2距離からセマンティックコスト行列を構築し、その後、セグメントインデックスの差に基づいた位置ペナルティを追加する。
- 最適輸送計算の安定化と数値的安定性を確保するため、平滑化ハイパーパrameter λ = 7×med(C) を適用する。
- α=0.4(UCF-101、HMDB-51)および α=0.8(SMSM-V2)で、セマンティックコストと位置コストの重み付き組み合わせを実装し、すべてのデータセットで σ=1.2 を使用する。
- SGDを用いてモデルを訓練し、C3D用に0.001、その他のパラメータ用に0.01の学習率を別々に設定し、2000エピソードごとに0.2倍に減衰させる。
実験結果
リサーチクエスチョン
- RQ1統一されたメトリック学習フレームワークは、少数ショット行動認識において、セマンティックな内容と時間的順序の両方を効果的にバランスできるか?
- RQ2位置正則化を施した最適輸送は、コンテンツに敏感な行動クラスと順序に敏感な行動クラスの両方の性能をどのように向上させるか?
- RQ3標準的な少数ショット行動認識ベンチマークにおいて、CMOTは集約ベースおよびマッチングベースのベースラインをどの程度上回るか?
- RQ4α や σ といったハイパーパrameterの選択に、CMOTの性能はどの程度感度を示すか?
主な発見
- CMOTは、N-way K-shot設定下でUCF-101、HMDB-51、SMSM-V2で最先端の性能を達成し、優れた一般化能力を示した。
- UCF-101では、5-way 1-shot精度が85.2%に達し、フレームの集約や厳密な系列マッチングに依存する従来手法を上回った。
- HMDB-51では、5-way 1-shot精度が68.9%に達し、より困難で行動が曖昧な動画に対して強いロバストネスを示した。
- SMSM-V2では、5-way 1-shot精度が74.1%に達し、微細な差異と長い時間窓を含む行動認識において有効性を確認した。
- アブレーションスタディの結果、セマンティックコストと位置コストの両方が不可欠であることが確認され、特に順序に敏感な行動では位置ペナルティが性能向上に顕著に寄与した。
- ハイパーパrameterの変動に対してもロバストであり、SMSM-V2では α=0.8、UCF-101およびHMDB-51では α=0.4 で最適な性能が達成された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。