Skip to main content
QUICK REVIEW

[论文解读] Garbage in, garbage out: Zero-shot detection of crime using Large Language Models

Anj Simmons, Rajesh Vasa|arXiv (Cornell University)|Jul 4, 2023
Multimodal Machine Learning Applications被引用 4
一句话总结

本文提出利用大型语言模型(LLMs)通过其对高质量监控视频文本描述的常识推理能力,实现零样本犯罪检测。尽管GPT-4在人工创建的描述上实现了最先进性能,但自动化视频到文本的方法因输出质量低下而失败,导致当前技术下端到端自动化犯罪检测不可行。

ABSTRACT

This paper proposes exploiting the common sense knowledge learned by large language models to perform zero-shot reasoning about crimes given textual descriptions of surveillance videos. We show that when video is (manually) converted to high quality textual descriptions, large language models are capable of detecting and classifying crimes with state-of-the-art performance using only zero-shot reasoning. However, existing automated video-to-text approaches are unable to generate video descriptions of sufficient quality to support reasoning (garbage video descriptions into the large language model, garbage out).

研究动机与目标

  • 探究大型语言模型是否能基于监控视频的文本描述进行零样本犯罪推理。
  • 评估最先进大型语言模型(如GPT-4)在无需微调或标注训练样本的情况下检测和分类犯罪的表现。
  • 识别并分析现有自动化视频到文本流水线在实现可靠下游犯罪检测方面的局限性。
  • 创建并发布一个包含168个由人工标注的监控视频描述的新数据集,用于基准测试基于大型语言模型的犯罪检测。
  • 突出显示高质量人工描述与低质量自动化输出之间存在的关键差距,该差距影响了大型语言模型在犯罪检测中实现准确推理的能力。

提出的方法

  • 该方法涉及将监控视频转换为由人工撰写的详细、高质量的文本描述。
  • 使用固定的提示模板,指导大型语言模型列出可能的解释,并将其分类到预定义的犯罪类别中。
  • 应用思维链提示(chain-of-thought prompting),引导大型语言模型在输出单一犯罪类别前进行逐步推理。
  • 评估大型语言模型(GPT-4)仅基于文本描述正确分类犯罪的能力,且不进行任何微调。
  • 测试并比较了自动化视频到文本流水线(包括图像字幕生成、基于大型语言模型的视觉模型以及目标跟踪)与人工描述的表现。
  • 评估了自动化描述的保真度和客观性,特别是关于身份追踪、动作细节以及幻觉现象。

实验结果

研究问题

  • RQ1当提供高质量的监控视频文本描述时,大型语言模型能否以高准确率实现零样本犯罪检测?
  • RQ2自动化视频到文本方法与人工标注的描述相比,在支持基于大型语言模型的犯罪推理方面表现如何?
  • RQ3自动化视频到文本流水线中存在哪些具体缺陷,导致大型语言模型无法实现可靠的犯罪检测?
  • RQ4自动化描述中幻觉、细节缺失或身份追踪失败在多大程度上降低了大型语言模型的性能?
  • RQ5现有的多模态或视觉-语言模型能否生成适合实现客观、透明且准确犯罪检测的描述?

主要发现

  • 当提供高质量的人工标注视频描述时,GPT-4在零样本犯罪检测中实现了最先进性能。
  • 自动化视频到文本方法(包括图像字幕生成和基于大型语言模型的视觉模型)生成的描述缺乏关键细节,如行为者身份和动作具体性,而这些是推理所必需的。
  • 目标跟踪系统未能在时间维度上保持身份一致性,导致出现如“人物3”或“人物5”等混淆性指代,阻碍了对犯罪意图的时间推理。
  • 基于大型语言模型的视觉模型经常产生幻觉,例如错误声称某场景中一群人正在打台球,而实际上并无此类活动,从而引入偏见和不准确性。
  • COCO目标检测数据集缺乏武器类别,限制了模型检测暴力犯罪的能力,凸显了当前基准测试中的关键数据缺口。
  • 尽管大型语言模型推理能力强大,但整体系统在实际中仍失败,原因在于‘垃圾进,垃圾出’——自动化描述质量过低,无法支持可靠的犯罪检测。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。