Skip to main content
QUICK REVIEW

[论文解读] CLIP-TSA: CLIP-Assisted Temporal Self-Attention for Weakly-Supervised Video Anomaly Detection

Hyekang Kevin Joo, Khoa Vo|arXiv (Cornell University)|Dec 9, 2022
Anomaly Detection Techniques and Applications被引用 7
一句话总结

该论文提出了一种新型弱监督视频异常检测框架 CLIP-TSA,利用 CLIP 编码的视觉特征与时间自注意力(TSA)机制,提升异常定位性能。通过用 CLIP 特征替代传统的 C3D/I3D 主干网络,并应用可微分的 top-κ 注意力机制突出异常片段,CLIP-TSA 在 UCF-Crime、ShanghaiTech Campus 和 XD-Violence 数据集上均取得了最先进性能,显著优于先前方法。

ABSTRACT

Video anomaly detection (VAD) -- commonly formulated as a multiple-instance learning problem in a weakly-supervised manner due to its labor-intensive nature -- is a challenging problem in video surveillance where the frames of anomaly need to be localized in an untrimmed video. In this paper, we first propose to utilize the ViT-encoded visual features from CLIP, in contrast with the conventional C3D or I3D features in the domain, to efficiently extract discriminative representations in the novel technique. We then model temporal dependencies and nominate the snippets of interest by leveraging our proposed Temporal Self-Attention (TSA). The ablation study confirms the effectiveness of TSA and ViT feature. The extensive experiments show that our proposed CLIP-TSA outperforms the existing state-of-the-art (SOTA) methods by a large margin on three commonly-used benchmark datasets in the VAD problem (UCF-Crime, ShanghaiTech Campus, and XD-Violence). Our source code is available at https://github.com/joos2010kj/CLIP-TSA.

研究动机与目标

  • 解决仅有视频级别标签的弱监督视频异常检测(VAD)挑战,降低标注负担。
  • 克服传统主干网络(如 C3D、I3D)在动作识别上预训练后,在异常检测中存在领域差距的局限性。
  • 通过建模时间连贯性并识别显著异常模式,提升未剪辑视频中异常片段的定位能力。
  • 在 MIL 框架下设计可微分的 top-κ 注意力机制,有效选择最异常的片段。
  • 验证结合 CLIP 的视觉-语言特征与新型时间注意力机制在异常检测中的有效性。

提出的方法

  • 利用 CLIP 的 ViT 基础视觉编码器,从每个片段的中间帧提取丰富且具有判别性的特征,替代传统的动作识别主干网络。
  • 将每段视频划分为固定长度(δ=16)的片段,并使用 CLIP 将每个片段表示为 512 维特征向量,每段视频形成 T=32 个片段的序列。
  • 引入时间自注意力(TSA)机制,根据异常得分重新加权片段特征,增强对异常片段的关注,同时抑制正常片段。
  • 应用可微分的 top-κ 函数,通过硬注意力机制选择最异常的 κ 个片段(κ = 0.7×T),实现在 MIL 框架下的端到端训练。
  • 使用差异最大化训练器进行模型训练,该方法鼓励对正样本(异常)视频给予更高注意力,对负样本(正常)视频给予更低注意力。
  • 使用 MLP 分数网络预测异常得分,并采用 Adam 优化器、学习率 0.001 和批量大小 16,实现整个模型的端到端优化。

实验结果

研究问题

  • RQ1与基于动作识别的主干网络(如 C3D 和 I3D)相比,CLIP 编码的视觉特征是否能提升视频异常检测的表征学习能力?
  • RQ2在仅有视频级别标签的弱监督设置下,所提出的时序自注意力(TSA)机制是否能有效定位异常片段?
  • RQ3CLIP 特征与 TSA 的结合在标准 VAD 基准测试中与最先进方法相比表现如何?
  • RQ4可微分的 top-κ 注意力机制在弱监督异常检测中对模型性能的提升程度如何?
  • RQ5所提出方法在具有不同异常类型与时间模式的多样化数据集上是否具备良好的泛化能力?

主要发现

  • 在 UCF-Crime 数据集上,CLIP-TSA 的 AUC@ROC 达到 87.58%,比之前最先进方法高出 3.5 个百分点。
  • 在 ShanghaiTech Campus 数据集上,CLIP-TSA 的 AUC@ROC 达到 98.32%,较第二名方法提升 1.11%,较早期最先进方法提升 12.89%。
  • 在 XD-Violence 数据集上,CLIP-TSA 的 AUC@PR 达到 82.19%,显著优于所有纯视觉基线方法,并与或超过多模态最先进方法。
  • 消融实验表明,CLIP 特征与 TSA 均有显著贡献:移除 TSA 后,UCF-Crime 上性能下降最多达 1.5%,ShanghaiTech 上下降最多达 1.2%。
  • 将 CLIP 替换为 C3D 或 I3D 会导致 UCF-Crime 和 ShanghaiTech 上性能下降 3.5–4.5 个百分点,证明 CLIP 特征的优越性。
  • 可微分的 top-κ 函数能有效识别最异常的片段,即使在复杂场景中,模型也始终关注异常区域。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。