Skip to main content
QUICK REVIEW

[論文レビュー] Action Spotting using Dense Detection Anchors Revisited: Submission to the SoccerNet Challenge 2022

João V. B. Soares, Avijit Shah|arXiv (Cornell University)|Jun 15, 2022
Anomaly Detection Techniques and Applications被引用数 5
ひとこと要約

本論文は、SoccerNet Challenge 2022 アクションスポットトラックにおける1位の提出であり、特徴量の時間的リサンプリング、ResNetとCombination特徴量のラテントフュージョン、および変更された Soft-NMS 後処理戦略を用いて、密度検出アンカーメソッドを強化することで、最先端の性能を達成した。この手法により、チャレンジのテストセットにおいて、67.8のタイトな平均mAPを達成し、同じ評価プロトコル下で先行手法を顕著に上回った。

ABSTRACT

This brief technical report describes our submission to the Action Spotting SoccerNet Challenge 2022. The challenge was part of the CVPR 2022 ActivityNet Workshop. Our submission was based on a recently proposed method which focuses on increasing temporal precision via a densely sampled set of detection anchors. Due to its emphasis on temporal precision, this approach had shown significant improvements in the tight average-mAP metric. Tight average-mAP was used as the evaluation criterion for the challenge, and is defined using small temporal evaluation tolerances, thus being more sensitive to small temporal errors. In order to further improve results, here we introduce small changes in the pre- and post-processing steps, and also combine different input feature types via late fusion. These changes brought improvements that helped us achieve the first place in the challenge and also led to a new state-of-the-art on SoccerNet's test set when using the dataset's standard experimental protocol. This report briefly reviews the action spotting method based on dense detection anchors, then focuses on the modifications introduced for the challenge. We also describe the experimental protocols and training procedures we used, and finally present our results.

研究の動機と目的

  • スポーツ動画におけるアクションスポットの時間的精度を向上させること、特にタイトな評価許容誤差下での性能向上を目的とする。
  • 既存の特徴量セットにおける低頻度(1秒ごと)という制限を是正し、小さな時間的許容誤差下でも正確な検出を可能にすること。
  • 補完的特徴タイプ(Combination と ResNet)のラテントフュージョンと最適化された後処理により、性能を向上させること。
  • 標準評価プロトコル下でSoccerNetテストセットにおいて最先端の結果を達成すること。
  • リサンプリングとSoft-NMSの有効性を、タイトな平均mAP最適化の観点から実証すること。

提案手法

  • 本手法は、1秒または2秒ごとに配置されたアンカーを用いた1次元U-Netバックボーンを採用し、アクション検出における高い時間的精度を実現する。
  • 各アンカーは検出の信頼度と、予測されたアクション開始時刻に信頼度をずらす微細な時間的ディスプレースメントを予測する。
  • タイトな平均mAPの許容誤差半径が0.5秒刻みであるのと整合させるために、特徴量を1秒から2秒に線形補間を用いてリサンプリングした。
  • ラテントフュージョンでは、バリデーションデータ上で最適な重みを探索し、重み付き平均によるログティスの融合により、リサンプリング済みのCombination特徴量とResNet特徴量のモデルを統合した。
  • 簡素化されたSoft-NMS後処理手法を適用し、重複する検出同士の時間的距離に基づく減衰関数を用いて、信頼度が低い予測を抑制した。
  • 最終的な検出セットは、バリデーションセット上でタイトな平均mAPを最適化した8秒のウィンドウサイズを用いてSoft-NMSを適用した後、得られたものである。

実験結果

リサーチクエスチョン

  • RQ11秒から2秒にリサンプリングされた特徴量は、タイトな平均mAP評価下で検出精度を向上させ得るか?
  • RQ2補完的特徴タイプ(Combination と ResNet)のラテントフュージョンは、アクションスポットの性能向上に寄与するか?
  • RQ3より小さなウィンドウサイズを用いた変更されたSoft-NMS戦略は、標準NMSに比べてタイトな平均mAPを向上させるか?
  • RQ4リサンプリング、ラテントフュージョン、最適化されたSoft-NMSの組み合わせにより、SoccerNetテストセットで最先端の性能が達成されるか?
  • RQ5特徴量リサンプリングとラテントフュージョンによる性能向上は、異なる評価プロトコルにわたり一貫性を示すか?

主な発見

  • Combination特徴量を1秒から2秒にリサンプリングすることで、評価指標の0.5秒刻みの許容誤差と整合性を高め、タイトな平均mAPが60.7から62.6に向上した。
  • 標準NMS(20秒ウィンドウ)ではなく、8秒ウィンドウを用いたSoft-NMSを適用することで、タイトな平均mAPがわずかだが一貫して向上した。
  • リサンプリング済みのCombination特徴量とResNet特徴量のラテントフュージョンにより、最高のチャレンジ成績が達成された:タイトな平均mAP 67.8、標準平均mAP 78.0。
  • ResNet特徴量の追加により、同じリサンプリング済みCombination特徴量で学習した2つのモデルをアンサンブルするのと比較して、より大きな性能向上が得られた。これは、特徴量の補完性を示している。
  • 最終的手法により、SoccerNetテストセットで新たな最先端性能が達成された。標準プロトコル下では65.1のタイトな平均mAP、チャレンジプロトコル下では67.8のタイトな平均mAPを達成した。
  • 結果から、タイトな平均mAPの最適化には、後処理と特徴量周波数の最適化が不可欠であることが示された。これは、標準平均mAPよりも小さな時間的誤差に敏感であるためである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。