[论文解读] TinyAction Challenge: Recognizing Real-world Low-resolution Activities in Videos
本文介绍了TinyVIRAT-v2,一个从真实安防视频中提取的自然发生的低分辨率动作基准数据集,并举办了TinyAction挑战赛,以推动视频中微小、遥远动作的识别。挑战赛结果表明,当前最先进模型在低分辨率动作上的表现较差,而专用架构则显著提升了F1得分(最高达0.47),证明了在真实世界视频分析中需要专门的方法。
This paper summarizes the TinyAction challenge which was organized in ActivityNet workshop at CVPR 2021. This challenge focuses on recognizing real-world low-resolution activities present in videos. Action recognition task is currently focused around classifying the actions from high-quality videos where the actors and the action is clearly visible. While various approaches have been shown effective for recognition task in recent works, they often do not deal with videos of lower resolution where the action is happening in a tiny region. However, many real world security videos often have the actual action captured in a small resolution, making action recognition in a tiny region a challenging task. In this work, we propose a benchmark dataset, TinyVIRAT-v2, which is comprised of naturally occuring low-resolution actions. This is an extension of the TinyVIRAT dataset and consists of actions with multiple labels. The videos are extracted from security videos which makes them realistic and more challenging. We use current state-of-the-art action recognition methods on the dataset as a benchmark, and propose the TinyAction Challenge.
研究动机与目标
- 填补动作识别研究中针对真实安防视频中常见低分辨率、远距离动作的空白。
- 构建一个反映低分辨率视频动作识别真实挑战的基准数据集,包括颗粒感、噪声和小空间范围等因素。
- 举办竞赛挑战,以激发针对微小动作识别专门设计的模型架构的研究。
- 提供一个多标签、多动作的数据集,包含室内外场景,以提升模型的泛化能力。
- 评估并比较最先进模型在低分辨率视频数据上的表现,以建立基线并突出其性能局限。
提出的方法
- 通过从VIRAT和MEVA数据集的真实安防视频中提取低分辨率动作片段,构建TinyVIRAT-v2。
- 通过保留原始视频质量(包括噪声和颗粒感)而非人为降低高分辨率视频的分辨率,确保数据集的真实性。
- 设计多标签标注方案,使每个视频可包含多个动作,从而增加复杂性。
- 采用现有的最先进3D卷积神经网络架构(I3D、ResNet-3D、R(2+1)D、WideResNet-3D),通过移除池化层以适配低分辨率输入。
- 使用各类平均的精确率、召回率和F1分数评估模型,参赛者使用学习得到的阈值预测多热编码动作向量。
- 举办TinyAction挑战赛,并通过评估服务器根据整体F1分数对团队进行排名,以促进社区驱动的创新。
实验结果
研究问题
- RQ1现有最先进动作识别模型在自然发生的低分辨率视频片段上的表现如何?
- RQ2视频分辨率和每类样本数量对低分辨率设置中动作识别模型性能有何影响?
- RQ3专用架构是否能在真实世界视频数据的微小动作识别中显著优于标准模型?
- RQ4在低分辨率基准中包含室内场景如何影响模型的泛化能力和性能?
- RQ5在低分辨率视频片段中同时识别多个动作的关键挑战是什么?
主要发现
- 基线R(2+1)D模型在TinyVIRAT-v2上取得了0.32的最高F1分数,表明当前最先进模型在低分辨率动作上的性能有限。
- 表现最佳的团队DeepBlue取得了0.47的F1分数,显著优于最佳基线模型,证明了专用架构的潜力。
- 性能与平均分辨率和每类训练样本数量强相关,如图5和图6所示,表明对数据量和分辨率敏感。
- 挑战赛优胜模型的精确率(0.51)和召回率(0.49)更高,表明在多标签预测中实现了更好的平衡性,优于基线模型。
- 基线模型与挑战赛优胜者之间的性能差距凸显了当前模型在真实世界低分辨率动作识别中的不足。
- TinyVIRAT-v2包含室内场景和真实的视频退化,增加了数据集的复杂性,更好地反映了真实世界部署条件。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。