[논문 리뷰] Garbage in, garbage out: Zero-shot detection of crime using Large Language Models
이 논문은 감시 영상의 고품질 텍스트 기반 기술을 활용하여 대규모 언어 모델(Large Language Models, LLMs)을 사용해 제로샷 범죄 탐지를 수행하는 것을 제안한다. 일반적인 공통 지식 추론 능력을 활용함으로써, 수동으로 작성된 기술서에 대해 GPT-4는 최고의 성능을 기록하지만, 저품질 출력을 유발하는 자동화된 영상에서 텍스트로의 변환 방법은 이를 실패하게 하여 현재 기술로는 종단 간 자동 범죄 탐지가 불가능하다.
This paper proposes exploiting the common sense knowledge learned by large language models to perform zero-shot reasoning about crimes given textual descriptions of surveillance videos. We show that when video is (manually) converted to high quality textual descriptions, large language models are capable of detecting and classifying crimes with state-of-the-art performance using only zero-shot reasoning. However, existing automated video-to-text approaches are unable to generate video descriptions of sufficient quality to support reasoning (garbage video descriptions into the large language model, garbage out).
연구 동기 및 목표
- 대규모 언어 모델(LLM)이 감시 영상의 텍스트 기술서를 바탕으로 피학습(fine-tuning) 없이 제로샷 추론을 수행할 수 있는지 조사하는 것.
- GPT-4와 같은 최신 LLM의 성능을 피학습 또는 레이블링된 학습 예제 없이 범죄 탐지 및 분류에 대해 평가하는 것.
- 기존 자동화된 영상에서 텍스트로의 파ip라인의 한계를 규명하고, 이로 인해 신뢰할 수 있는 후속 범죄 탐지가 방해받는 이유를 분석하는 것.
- LLM 기반의 범죄 탐지 평가를 위한 기준으로 사용하기 위해 168개의 인간이 애너테이션한 감시 영상 기술서로 구성된 새로운 데이터셋을 구축하고 공개하는 것.
- 정확한 LLM 추론을 위한 범죄 탐지에서 고품질 인간 기술서와 저품질 자동 출력 간의 핵심 격차를 부각하는 것.
제안 방법
- 감시 영상들을 인간이 작성한 상세하고 고품질의 텍스트 기술서로 변환하는 방법을 사용한다.
- 고정된 프롬프트 템플릿을 사용하여 LLM이 가능한 설명을 나열하고 사전 정의된 범죄 카테고리로 분류하도록 지시한다.
- 단일 범죄 카테고리 출력 전에 단계별 추론을 유도하기 위해 체인 오브 톰(Chain-of-Thought) 프롬프팅을 적용한다.
- GPT-4가 피학습 없이도 텍스트 기술서만을 기반으로 정확하게 범죄를 분류할 수 있는 능력을 평가한다.
- 이미지 캡션, LLM 기반 시각 모델, 물체 추적 기반의 자동화된 영상에서 텍스트로의 파이프라인을 테스트하고 비교한다.
- 특히 신원 추적, 행동 세부 정보, 환상(Hallucination) 측면에서 자동화된 기술서의 충실도와 객관성을 평가한다.
실험 결과
연구 질문
- RQ1고품질의 감시 영상 텍스트 기술서가 제공될 경우, 대규모 언어 모델이 높은 정확도로 제로샷 범죄 탐지 수행이 가능한가?
- RQ2자동화된 영상에서 텍스트로의 변환 방법이 인간 애너테이션 기반 기술서와 비교해 LLM 기반의 범죄 추론을 뒷받침하는 데 어떤가?
- RQ3자동화된 영상에서 텍스트로의 파이프라인에서 어떤 특정한 한계가 LLM 기반의 신뢰할 수 있는 범죄 탐지 방해하는가?
- RQ4자동화된 기술서에서 환상, 세부 정보 부족, 또는 신원 추적 실패가 LLM 성능에 어느 정도 악영향을 미치는가?
- RQ5기존의 다중 모odal 또는 시각-언어 모델이 객관적이고 투명하며 정확한 범죄 탐지에 적합한 기술서를 생성할 수 있는가?
주요 결과
- GPT-4는 고품질의 인간 애너테이션 기반 영상 기술서가 제공될 경우 제로샷 범죄 탐지에서 최고의 성능을 기록했다.
- 이미지 캡션 및 LLM 기반 시각 모델을 포함한 자동화된 영상에서 텍스트로의 변환 방법은 주체의 신원 및 행동의 구체성과 같은 핵심적인 세부 정보가 부족한 기술서를 생성하여 추론에 필수적인 요소를 누락시켰다.
- 물체 추적 시스템은 시간에 걸쳐 일관된 신원 유지에 실패하여 '사람 3', '사람 5'와 같은 혼란스러운 참조를 유도하여 범죄 의도에 대한 시간적 추론을 방해했다.
- LLM 기반의 시각 모델은 종종 행동이나 물체를 환상적으로 생성했으며, 예를 들어 실제로는 당구를 치지 않은 장면에서 그룹이 당구를 하고 있다고 잘못 기술하여 편향과 정확도 저하를 유발했다.
- COCO 물체 검출 데이터셋은 무기를 포함하지 않아, 모델이 폭력 범죄 탐지 능력을 제한하며 현재 벤치마크에서의 핵심 데이터 격차를 드러냈다.
- 강력한 LLM 추론 능력에도 불구하고, 전체 시스템은 실질적으로 실패했다. 이는 '쓰레기 들어가면 쓰레기 나온다(Garbage in, garbage out)' 원칙에 기인하여, 자동화된 기술서의 품질이 너무 낮아 신뢰할 수 있는 범죄 탐지에 기여하지 못하기 때문이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.