[论文解读] MIST: Multiple Instance Self-Training Framework for Video Anomaly Detection
MIST 提出了一种用于弱监督视频异常检测的多实例自训练框架,通过稀疏连续采样策略生成伪标签,并引入自引导注意力模块以突出异常区域,从而提升判别性特征学习。该方法在 ShanghaiTech 数据集上实现了 94.83% 的帧级 AUC,优于先前方法,且推理速度更快、FLOPs 更低。
Weakly supervised video anomaly detection (WS-VAD) is to distinguish anomalies from normal events based on discriminative representations. Most existing works are limited in insufficient video representations. In this work, we develop a multiple instance self-training framework (MIST)to efficiently refine task-specific discriminative representations with only video-level annotations. In particular, MIST is composed of 1) a multiple instance pseudo label generator, which adapts a sparse continuous sampling strategy to produce more reliable clip-level pseudo labels, and 2) a self-guided attention boosted feature encoder that aims to automatically focus on anomalous regions in frames while extracting task-specific representations. Moreover, we adopt a self-training scheme to optimize both components and finally obtain a task-specific feature encoder. Extensive experiments on two public datasets demonstrate the efficacy of our method, and our method performs comparably to or even better than existing supervised and weakly supervised methods, specifically obtaining a frame-level AUC 94.83% on ShanghaiTech.
研究动机与目标
- 解决仅使用视频级标注的弱监督视频异常检测(WS-VAD)所面临的表示学习限制问题。
- 通过在多实例学习(MIL)框架下对片段级标签进行优化,克服现有方法中伪标签噪声过大的问题。
- 开发一种任务特定的特征编码器,无需外部标注即可自适应地聚焦于异常区域。
- 通过两阶段自训练方案,联合优化伪标签生成与特征编码,提升效率与准确性。
- 在保持实时流视频高检测性能的同时,减小领域差距并降低计算成本。
提出的方法
- 提出一种多实例伪标签生成器,利用稀疏连续采样策略,为异常视频生成更可靠的片段级伪标签。
- 引入一种自引导注意力增强型特征编码器(E_SGA),利用片段级标注与伪标签动态突出异常区域。
- 采用结合稀疏-连续采样的深层MIL排序损失,通过关注异常片段周围的上下文线索,提升伪标签质量。
- 应用两阶段自训练方案:首先从预训练编码器生成伪标签,然后利用正常视频与伪标签标注的异常视频联合优化特征编码器。
- 采用最小-最大归一化与时间平滑等后处理技术降低标签噪声,避免迭代优化。
- 利用梯度累积与大批次训练,在训练过程中进一步抑制标签噪声。

实验结果
研究问题
- RQ1自训练框架是否能仅使用视频级标注,提升弱监督视频异常检测中的特征表示学习?
- RQ2如何使伪标签生成更具鲁棒性,以减少来自视频级监督的噪声?
- RQ3自引导注意力机制是否能在无人工标注边界框的情况下有效定位异常区域?
- RQ4两阶段自训练流程是否在准确率与效率方面优于现有迭代或端到端训练策略?
- RQ5所提框架是否能在保持低计算成本与快速推理速度的同时,实现最先进性能?
主要发现
- MIST 在 ShanghaiTech 数据集上实现了 94.83% 的帧级 AUC,优于现有监督与弱监督方法。
- MIST-I3D 模型推理速度达 324.46 FPS,仅需 45.68G FLOPs,显著快于 Zhong et al. [35](需 10 路测试与 386.2G FLOPs)。
- 自引导注意力模块在 7 个可视化案例中的 5 个成功突出异常区域,证明了其空间注意力的有效性。
- 经优化后,MIST 在 ShanghaiTech 上的 AUC 提升了 +8.48 个百分点(从 58.66% 提升至 67.14%),表明降噪技术有效。
- MIST-C3D 模型在优化后达到 73.37% AUC,表明即使使用轻量化主干网络,性能依然强劲。
- 该框架在准确率与推理速度方面均优于最先进方法 Zhong et al. [35],尤其在 ShanghaiTech 数据集上表现更优。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。