[论文解读] Uncertainty-aware Score Distribution Learning for Action Quality Assessment
本文提出不确定性感知的分数分布学习(USDL)与多路径USDL(MUSDL)用于动作质量评估,将分数建模为概率分布以处理来自多位裁判或不同难度等级的标签模糊性。通过优化真实标签与预测分数分布之间的KL散度,该方法在三个AQA数据集上达到最先进性能,其中MUSDL在JIGSAWS数据集上平均斯皮尔曼等级相关系数达0.70,在AQA-7数据集上达0.81。
Assessing action quality from videos has attracted growing attention in recent years. Most existing approaches usually tackle this problem based on regression algorithms, which ignore the intrinsic ambiguity in the score labels caused by multiple judges or their subjective appraisals. To address this issue, we propose an uncertainty-aware score distribution learning (USDL) approach for action quality assessment (AQA). Specifically, we regard an action as an instance associated with a score distribution, which describes the probability of different evaluated scores. Moreover, under the circumstance where fine-grained score labels are available (e.g., difficulty degree of an action or multiple scores from different judges), we further devise a multi-path uncertainty-aware score distributions learning (MUSDL) method to explore the disentangled components of a score. We conduct experiments on three AQA datasets containing various Olympic actions and surgical activities, where our approaches set new state-of-the-arts under the Spearman's Rank Correlation.
研究动机与目标
- 解决由主观裁判评分或多个评分维度引起的动作评分标签固有的模糊性问题。
- 通过将分数建模为概率分布而非单一数值,提升动作质量评估性能。
- 利用细粒度标签(如单个裁判评分或难度系数)以增强模型性能。
- 设计一种多路径学习框架,以解耦并融合不同的评分维度,实现更高精度。
- 通过显式建模监督中的不确定性,在基准AQA数据集上超越现有回归方法。
提出的方法
- 将最终动作评分建模为以真实标签为中心的高斯分布,实现不确定性感知的监督。
- 训练基于3D ConvNets的模型以预测分数分布,并使用预测分布与真实分布之间的Kullback-Leibler(KL)散度进行优化。
- 提出MUSDL以处理多种细粒度评分信号(如单个裁判评分或难度乘数),通过为每个分量设置独立路径。
- 在推理阶段,使用相同的比赛规则(如去除最高/最低分并应用难度乘数)融合多路径预测结果,生成最终分数。
- 采用每视频均匀采样160帧并划分为10个片段作为输入,分段策略通过消融实验进行优化。
- 采用I3D作为主干网络,并端到端训练,使用KL散度损失学习不确定性感知表征。
实验结果
研究问题
- RQ1与单值回归相比,将动作评分建模为概率分布是否能提升动作质量评估性能?
- RQ2引入细粒度评分标注(如单个裁判评分或难度等级)对模型性能有何提升作用?
- RQ3不同的视频分段策略对动作质量的时间建模有何影响?
- RQ4多路径学习框架能否有效解耦并融合不同的评分维度以提升准确性?
- RQ5不确定性感知的分布学习是否能提升模型在多样化AQA数据集上的鲁棒性与泛化能力?
主要发现
- MUSDL在JIGSAWS数据集上实现0.70的平均斯皮尔曼等级相关系数,优于先前最先进方法。
- 在AQA-7数据集上,MUSDL达到0.81的斯皮尔曼相关系数,显著优于以往方法。
- 10段分段策略(步长10,记为10-seg-s1)在所有分段方案中表现最佳,优于6-seg与10-seg-s2方案。
- 采用高斯分布建模的USDL在性能上优于标准回归方法,能够捕捉标签不确定性。
- 可视化结果表明,动作的最终阶段(如入水阶段)对分数分布影响最大,且在溅水剧烈的片段中低分出现峰值。
- 即使在极端评分样本稀疏的情况下,该方法仍表现出鲁棒性,但此类样本的性能仍具挑战。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。