[论文解读] Multi-Moments in Time: Learning and Interpreting Models for Multi-Action Video Understanding
本文提出 Multi-Moments in Time (M-MiT),一个大规模多标签视频数据集,包含超过两百万个动作标签,覆盖一百万个三秒视频,支持多动作视频理解模型的训练与评估。本文提出新颖方法——wLSEP 损失用于长尾学习,mCAM 用于可视化多动作注意力,以及 Action Network Dissection 用于解释学习到的动作概念,显著提升了模型的可解释性与下游任务的迁移性能。
Videos capture events that typically contain multiple sequential, and simultaneous, actions even in the span of only a few seconds. However, most large-scale datasets built to train models for action recognition in video only provide a single label per video. Consequently, models can be incorrectly penalized for classifying actions that exist in the videos but are not explicitly labeled and do not learn the full spectrum of information present in each video in training. Towards this goal, we present the Multi-Moments in Time dataset (M-MiT) which includes over two million action labels for over one million three second videos. This multi-label dataset introduces novel challenges on how to train and analyze models for multi-action detection. Here, we present baseline results for multi-action recognition using loss functions adapted for long tail multi-label learning, provide improved methods for visualizing and interpreting models trained for multi-label action detection and show the strength of transferring models trained on M-MiT to smaller datasets.
研究动机与目标
- 解决单标签视频数据集无法捕捉视频中多个同时或顺序发生的动作的局限性。
- 开发一个可扩展的大规模多标签视频数据集,保留像 Moments in Time 这类现有单标签数据集的多样性与规模。
- 设计针对视频中多动作识别的新型训练目标与可解释性方法。
- 通过视觉注意力映射与特征分解,实现对模型的改进分析,用于多标签动作检测。
提出的方法
- 扩展 Moments in Time 数据集,构建 M-MiT,一个在一百万个三秒视频中包含超过两百万个动作标签的多标签数据集。
- 提出 wLSEP,即 LSEP 损失函数的加权版本,用于处理多标签视频学习中的长尾类别分布问题。
- 提出 mCAM(多标签类别激活映射),用于识别视频帧中对多个同时发生动作的预测有贡献的空间区域。
- 通过将新的单帧动作区域数据集整合到 NetDissect 框架中,开发 Action Network Dissection,以将学习到的特征解释为动作概念。
- 使用在 M-MiT 上预训练的 ResNet-50 主干网络,评估可解释性与迁移学习性能。
- 通过消融实验验证损失函数、可解释性增益以及在较小数据集上的迁移性能。
实验结果
研究问题
- RQ1当动作标签呈现长尾分布且单个视频中多个动作共现时,如何有效训练深度模型进行多动作视频识别?
- RQ2在考虑类别不平衡与长尾分布的情况下,哪些损失函数最适用于多标签视频动作识别?
- RQ3如何通过视觉注意力与特征分解提升深度模型在多动作检测中的可解释性?
- RQ4在 M-MiT 上训练的模型在通过迁移学习应用于较小下游数据集时,其泛化能力如何?
- RQ5将特定于动作的概念整合到网络解释框架中,是否能提升对有意义学习特征的识别能力?
主要发现
- M-MiT 数据集在一百万个三秒视频中包含超过两百万个动作标签,显著扩展了现有视频数据集的规模与多标签覆盖范围。
- wLSEP 损失函数通过引入类别权重来缓解数据不平衡问题,提升了长尾多标签动作识别的模型性能。
- mCAM 成功识别出帧中对多个同时发生动作的预测有贡献的多个空间区域,实现了对多动作活动的更好定位。
- Action Network Dissection 将可解释特征数量从 1,351 个(仅使用 Broden 概念)提升至 2,023 个(使用 Broden + 动作区域),其中包含 211 个可解释概念,包括 120 种不同动作。
- 在 Broden 数据集中引入动作概念后,可解释特征数量增加了 49%,表明动作特定概念对解释动作识别特征至关重要。
- 在 M-MiT 上训练的模型在较小下游数据集上表现出强大的迁移性能,证明了更丰富监督信号对泛化能力的积极作用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。