[論文レビュー] Uncertainty-aware Score Distribution Learning for Action Quality Assessment
本稿では、複数の審査員や難易度レベルによるラベルの曖昧さを扱うために、スコアを確率分布としてモデル化する不確実性対応スコア分布学習(USDL)およびマルチパスUSDL(MUSDL)を提案する。真のスコア分布と予測スコア分布のKLダイバージェンスを最適化することで、3つのAQAデータセットで最先端の性能を達成し、MUSDLはJIGSAWSで平均スピアマン相関0.70、AQA-7で0.81を達成した。
Assessing action quality from videos has attracted growing attention in recent years. Most existing approaches usually tackle this problem based on regression algorithms, which ignore the intrinsic ambiguity in the score labels caused by multiple judges or their subjective appraisals. To address this issue, we propose an uncertainty-aware score distribution learning (USDL) approach for action quality assessment (AQA). Specifically, we regard an action as an instance associated with a score distribution, which describes the probability of different evaluated scores. Moreover, under the circumstance where fine-grained score labels are available (e.g., difficulty degree of an action or multiple scores from different judges), we further devise a multi-path uncertainty-aware score distributions learning (MUSDL) method to explore the disentangled components of a score. We conduct experiments on three AQA datasets containing various Olympic actions and surgical activities, where our approaches set new state-of-the-arts under the Spearman's Rank Correlation.
研究の動機と目的
- 主観的な審査員評価や複数のスコア成分によるスコアラベルの本質的曖昧さに対処すること。
- スコアを単一の値としてではなく、確率分布としてモデル化することで、アクション品質評価を向上させること。
- 個々の審査員のスコアや難易度レベルといった細分化されたラベルを活用して、モデルの性能を向上させること。
- 異なるスコア成分を分離し統合するためのマルチパス学習フレームワークを開発すること。
- 監視における不確実性を明示的にモデル化することで、従来の回帰ベース手法に比べて、ベンチマークAQAデータセットで優れた性能を発揮すること。
提案手法
- 真のスコアラベルを中心とするガウス分布として最終スコアをモデル化し、不確実性を考慮した監視を可能にする。
- 3D ConvNetsベースのモデルを用いてスコア分布を予測し、予測分布と真の分布の間のKullback-Leibler(KL)ダイバージェンスを最適化して学習する。
- 個々の審査員のスコアや難易度乗数といった複数の細分化されたスコア信号を処理するために、MUSDLを導入。各成分に対して別々のパスを設ける。
- 推論時に、同じゲームルール(例:最高・最低スコアを除外し、難易度乗数を適用)を用いて複数のパスからの予測を統合し、最終スコアを生成する。
- 1ビデオあたり160フレームを均等にサンプリングし、10セグメントに分割する入力戦略を採用。セグメント戦略はアブレーションにより最適化された。
- バックボーンネットワークとしてI3Dを採用し、KLダイバージェンス損失を用いてエンドツーエンドで学習し、不確実性を考慮した表現を学習する。
実験結果
リサーチクエスチョン
- RQ1スコアを確率分布としてモデル化することで、単一値回帰と比較して、アクション品質評価の性能が向上するか?
- RQ2個々の審査員のスコアや難易度レベルといった細分化されたスコアアノテーションを組み込むことで、モデル性能はどのように向上するか?
- RQ3異なる動画セグメンテーション戦略が、アクション品質の時系列モデリングに与える影響は何か?
- RQ4マルチパス学習フレームワークは、異なるスコア成分を効果的に分離・統合し、より高い精度を達成できるか?
- RQ5不確実性対応の分布学習は、多様なAQAデータセットにわたってより頑健で一般化可能なモデルをもたらすか?
主な発見
- MUSDLはJIGSAWSデータセットで平均スピアマン相関0.70を達成し、先行する最先端手法を上回った。
- AQA-7データセットでは、MUSDLがスピアマン相関0.81を達成し、従来の手法を著しく上回った。
- ストライド10の10セグメント戦略(10-seg-s1)が、セグメンテーション戦略の中で最高の性能を示し、6-segや10-seg-s2を上回った。
- ガウス分布モデリングを用いたUSDLは、ラベルの不確実性を捉えることで、標準的な回帰手法に比べて性能が向上した。
- 可視化の結果、アクションの最終段階(例:水への浸入)がスコア分布に最も大きな影響を与え、スプラッシュが強いセグメントで低スコアがピークに達することが分かった。
- 極端なスコアが疎なサンプルに対しても、本手法は頑健であることが示されたが、このようなケースの性能向上は依然として挑戦的である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。