[论文解读] What and How Well You Performed? A Multitask Learning Approach to Action Quality Assessment
本文提出一种多任务学习方法,通过在新构建的大规模跳水数据集上使用3D卷积神经网络,联合优化动作质量评估(AQA)、细粒度动作分类和自然语言解说生成。该方法在AQA任务上达到90.44%的等级相关系数,性能优于单任务学习,且在泛化能力和AQA特定特征学习方面优于动作识别基线模型。
Can performance on the task of action quality assessment (AQA) be improved by exploiting a description of the action and its quality? Current AQA and skills assessment approaches propose to learn features that serve only one task - estimating the final score. In this paper, we propose to learn spatio-temporal features that explain three related tasks - fine-grained action recognition, commentary generation, and estimating the AQA score. A new multitask-AQA dataset, the largest to date, comprising of 1412 diving samples was collected to evaluate our approach (https://github.com/ParitoshParmar/MTL-AQA). We show that our MTL approach outperforms STL approach using two different kinds of architectures: C3D-AVG and MSCADC. The C3D-AVG-MTL approach achieves the new state-of-the-art performance with a rank correlation of 90.44%. Detailed experiments were performed to show that MTL offers better generalization than STL, and representations from action recognition models are not sufficient for the AQA task and instead should be learned.
研究动机与目标
- 通过联合学习多个相关任务(而不仅限于评分)来提升动作质量评估(AQA)性能。
- 解决单任务学习在AQA中的局限性,即仅依赖最终得分而无法捕捉性能的细微差异。
- 构建一个大规模、丰富标注的数据集,包含解耦的动作类别和面向AQA的解说,用于训练与评估。
- 证明多任务学习相比单任务学习能带来更好的泛化能力以及更具判别性的AQA特征表示。
- 在不同网络架构上验证该方法在未见动作上的可迁移性与鲁棒性。
提出的方法
- 提出一种多任务学习框架,联合训练3D CNN以从视频片段中预测AQA得分、细粒度动作类别和自然语言解说。
- 采用C3D-AVG和MSCADC架构作为主干网络,从视频片段中提取时空特征。
- 使用三种不同的损失函数:一种用于AQA回归,一种用于解耦动作分类,一种用于序列到序列的解说生成。
- 通过加权求和三个任务特定损失的联合优化方式,端到端训练整个网络,同时优化所有目标。
- 利用现有广播视频素材提取动作分类与解说的标签,最大限度减少额外标注成本。
- 通过在中间卷积层激活值上训练线性回归器,评估特征表示在未见动作上的零样本AQA性能。

实验结果
研究问题
- RQ1与单任务学习相比,联合学习动作描述、解说和质量评分是否能提升AQA性能?
- RQ2多任务学习的表征是否比仅针对动作识别学习的表征具有更好的泛化能力,尤其是在未见动作上?
- RQ3多任务学习的性能增益是否在不同网络架构上保持一致?
- RQ4通过多任务训练学习到的AQA特定特征是否在零样本AQA评估中优于动作识别预训练特征?
- RQ5包含详细动作与解说监督是否能带来更具可解释性与准确性的质量评估?
主要发现
- C3D-AVG-MTL模型与人工标注的AQA得分达到90.44%的等级相关系数,创下新的最先进性能记录。
- 多任务学习在所有训练集规模下均持续优于单任务学习,证明其泛化能力更强。
- 通过多任务训练学习到的AQA特定特征在未见动作(如体操跳马)上的泛化能力优于动作识别模型的特征。
- 在数据集外评估中,C3D-AVG-MTL模型相比动作识别基线模型保持更优性能,尤其在分布偏移情况下表现更佳。
- 在MTL模型中间层训练的线性回归器在AQA相关性上优于动作识别模型的对应结果,证实了其更优的特征学习能力。
- 在新构建的MTL-AQA数据集(1412个跳水样本)上训练的模型在其他动作上展现出强大的迁移能力,表明其具有广泛适用性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。