[论文解读] Few-shot Scene-adaptive Anomaly Detection
本文提出了一种基于元学习的 few-shot 场景自适应异常检测方法,通过仅使用少量帧,使预训练模型能够快速适应新的、未见过的监控场景。该方法在多个基准数据集上实现了最先进性能,显著优于微调基线方法,并在不同场景和模态(包括深度图像)之间表现出强大的泛化能力。
We address the problem of anomaly detection in videos. The goal is to identify unusual behaviours automatically by learning exclusively from normal videos. Most existing approaches are usually data-hungry and have limited generalization abilities. They usually need to be trained on a large number of videos from a target scene to achieve good results in that scene. In this paper, we propose a novel few-shot scene-adaptive anomaly detection problem to address the limitations of previous approaches. Our goal is to learn to detect anomalies in a previously unseen scene with only a few frames. A reliable solution for this new problem will have huge potential in real-world applications since it is expensive to collect a massive amount of data for each target scene. We propose a meta-learning based approach for solving this new problem; extensive experimental results demonstrate the effectiveness of our proposed method.
研究动机与目标
- 解决现有异常检测模型依赖于每个目标场景大规模数据且难以在不同摄像头位置间泛化的局限性。
- 提出一种新型 few-shot 场景自适应异常检测问题,即仅使用少量帧即可将模型适配至新场景,更贴近真实部署约束。
- 开发一种元学习框架,实现在未见场景上的快速适应,同时保持高检测准确率。
- 展示模型在多样化场景中的泛化能力,包括不同模态(如深度图像)的场景。
提出的方法
- 该方法使用元学习在任务分布上进行训练,每个任务模拟使用来自不同摄像头位置的数据对新场景进行 few-shot 适应。
- 在元训练过程中,模型通过仅使用来自该场景的少量支持帧,学习快速适应新场景。
- 主干网络架构为用于帧重建的 r-GAN 模型,该模型在推理阶段通过目标场景的少量帧进行微调。
- 通过在每个训练周期采样多个场景来优化元学习目标,以防止模型对任一单一场景过拟合。
- 在推理阶段,模型通过使用来自该场景的 K 个帧更新参数,实现对新场景的适应,随后对视频其余部分执行异常检测。
- 该方法利用一种任务特定的适应机制,通过 few-shot 适应协议更新模型参数,最小化正常帧上的重建误差。
实验结果
研究问题
- RQ1能否仅使用少量帧,无需大量微调,有效适应一个全新的、此前未见过的监控场景?
- RQ2与标准微调相比,元学习在跨多样化摄像头场景的泛化能力方面有何提升?
- RQ3该模型在视觉特征截然不同的场景(如深度图像或显著不同的环境)中,其泛化能力能达到何种程度?
- RQ4在每个元训练周期中增加采样的场景数量,是否能提升模型的鲁棒性和性能?
主要发现
- 在 Shanghai Tech 数据集上,所提方法在 K=1 时达到 AUC 80.60,在 K=10 时达到 82.38,平均优于微调基线超过 2%。
- 在更具挑战性的 UCF Crime 数据集上,该方法在跨数据集测试中相比基线实现了超过 20% 的性能提升,展现出强大的泛化能力。
- 该模型成功适应了使用深度图像的 UR Fall 数据集,其场景与训练数据差异极大,表明对模态变化具有鲁棒性。
- 在每个元训练周期中采样五个任务(N=5)的性能优于仅采样一个任务(N=1),表明多场景采样可提升泛化能力。
- 即使仅使用一个支持帧(K=1),元学习模型的性能仍优于标准微调,证明了元学习适应机制的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。