[论文解读] Evidential Deep Learning for Open Set Action Recognition
本文提出深度证据动作识别(DEAR),一种新颖的开放集动作识别方法,利用证据深度学习量化预测不确定性,使模型能够区分已知与未知动作。通过整合证据不确定性校准(EUC)与对比证据去偏(CED),DEAR 提升了对未知动作和静态背景偏见的鲁棒性,在 UCF-101、HMDB-51 和 Mimetics 数据集上的多个模型与基准测试中均实现了稳定的性能提升。
In a real-world scenario, human actions are typically out of the distribution from training data, which requires a model to both recognize the known actions and reject the unknown. Different from image data, video actions are more challenging to be recognized in an open-set setting due to the uncertain temporal dynamics and static bias of human actions. In this paper, we propose a Deep Evidential Action Recognition (DEAR) method to recognize actions in an open testing set. Specifically, we formulate the action recognition problem from the evidential deep learning (EDL) perspective and propose a novel model calibration method to regularize the EDL training. Besides, to mitigate the static bias of video representation, we propose a plug-and-play module to debias the learned representation through contrastive learning. Experimental results show that our DEAR method achieves consistent performance gain on multiple mainstream action recognition models and benchmarks. Code and pre-trained models are available at {\small{\url{https://www.rit.edu/actionlab/dear}}}.
研究动机与目标
- 解决开放集动作识别(OSAR)的挑战,即在存在分布外动作的真实世界场景中,模型需识别已知动作并拒绝未知动作。
- 克服现有基于图像的开放集识别方法在处理视频数据固有的时序动态与静态偏见方面存在的局限。
- 利用证据深度学习(EDL)构建原则化的不确定性估计框架,使模型能够通过为分布外动作分配高不确定性来实现‘知之为不知’。
- 缓解视频表征中的静态偏见——即模型过度依赖背景线索(如‘水’或‘天空’)——以提升对上下文无关动作的泛化能力。
- 设计一种即插即用模块,利用对比学习去除表征偏见,无需微调主干模型,从而增强开放集场景下的鲁棒性。
提出的方法
- 将动作识别建模为证据深度学习(EDL)问题,其中模型对每个类别预测一个狄利克雷分布,以表示该类别的证据。
- 提出一种新型损失函数——证据不确定性校准(EUC),通过正则化证据学习过程,防止模型在封闭集场景下产生过度自信的预测。
- 提出对比证据去偏(CED)模块,通过对比正负视频片段,利用对比学习学习对偏见不敏感的表征。
- 将 EUC 与 CED 作为即插即用组件集成到现有动作识别模型(如 TPN、TSM、I3D)中,实现端到端训练,仅需极少的架构修改。
- 利用预测不确定性(由证据推导得出)识别未知动作:高不确定性表示拒绝未知类别。
- 利用狄利克雷分布的特性,直接推断不确定性,无需蒙特卡洛采样或后验近似,从而实现高效且可扩展的不确定性估计。
实验结果
研究问题
- RQ1证据深度学习能否有效适配视频动作识别,以实现开放集识别中原则化的不确定性估计?
- RQ2所提出的证据不确定性校准(EUC)损失是否能改善模型校准性并降低预测过度自信,特别是在开放集条件下?
- RQ3对比学习能否有效去除视频表征中的偏见,减少对‘水’或‘天空’等静态背景线索的依赖?
- RQ4EUC 与 CED 的结合在 HMDB-51 和 Mimetics 等基准数据集上,能在多大程度上提升对未知动作的泛化能力?
- RQ5在不同主干模型(如 TPN、TSM、I3D)上,DEAR 在封闭集与开放集识别设置下的表现如何?
主要发现
- 在使用 TPN 主干模型时,DEAR 在 UCF-101 上取得 81.79% 的 top-1 准确率与 79.23% 的开放集 F1 分数,以 HMDB-51 作为未知数据,优于现有方法。
- 在开放集设置下,EUC 损失将期望校准误差(ECE)从 0.284 降低至 0.268,表明模型校准性得到改善,过度自信现象减少。
- 在使用 Kinetics 预训练模型时,CED 模块将无偏见的 Mimetics 数据集上的 top-1 准确率从 26.56% 提升至 34.38%,证明了其有效的去偏能力。
- 在 Mimetics 数据集上,DEAR 在启用 CED 的情况下取得 34.38% 的 top-1 准确率,显著优于基线(26.56%),展现出对上下文无关动作的鲁棒性。
- 混淆矩阵分析表明,若无 DEAR,来自 HMDB-51 的未知动作如‘投篮’常被误分类为 UCF-101 中的‘射箭’,这是由于静态背景偏见所致。
- DEAR 在保持封闭集识别高性能(如在 Kinetics 上达到 91.18% 的 top-1 准确率)的同时,显著提升了开放集泛化能力,证明了其双重有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。