[論文レビュー] Garbage in, garbage out: Zero-shot detection of crime using Large Language Models
本稿では、監視映像の高品質なテキスト記述に基づいて、一般常識的推論を活用することで、大規模言語モデル(LLM)を用いたゼロショット犯罪検出を提案する。GPT-4は手作業で作成された記述では最先端の性能を達成するが、低品質な出力により自動化された動画からテキストへの変換手法では失敗し、現在の技術ではエンドツーエンドの自動化された犯罪検出は不可能である。
This paper proposes exploiting the common sense knowledge learned by large language models to perform zero-shot reasoning about crimes given textual descriptions of surveillance videos. We show that when video is (manually) converted to high quality textual descriptions, large language models are capable of detecting and classifying crimes with state-of-the-art performance using only zero-shot reasoning. However, existing automated video-to-text approaches are unable to generate video descriptions of sufficient quality to support reasoning (garbage video descriptions into the large language model, garbage out).
研究の動機と目的
- 大規模言語モデル(LLM)が監視映像のテキスト記述に基づいてゼロショットで犯罪について推論できるかどうかを調査すること。
- GPT-4のような最先端のLLMが、ファインチューニングやラベル付きトレーニング例なしに犯罪を検出・分類する性能を評価すること。
- 既存の自動化された動画からテキストへのパイプラインの限界を特定・分析し、信頼できる下流の犯罪検出を妨げる要因を特定すること。
- LLMベースの犯罪検出のベンチマーク用に、168件の人が手作業でアノテートした監視映像記述の新しいデータセットを作成・公開すること。
- 高品質な人間による記述と低品質な自動出力との間の重要なギャップが、犯罪検出のための正確なLLM推論を可能にするかどうかを浮き彫りにすること。
提案手法
- 監視映像を人間が作成した詳細で高品質なテキスト記述に変換する手法を採用する。
- 固定されたプロンプトテンプレートを用いて、LLMに可能な説明を列挙させ、事前に定義された犯罪カテゴリに分類させる。
- 一連の思考プロセス(chain-of-thought)プロンプトを適用し、最終的な犯罪カテゴリを出力する前に段階的な推論を誘導する。
- GPT-4を、ファインチューニングなしにテキスト記述のみに基づいて犯罪を正しく分類できるかを評価する。
- 画像キャプション、LLMベースのビジョンモデル、オブジェクト追跡を含む自動化された動画からテキストへのパイプラインをテスト・比較する。
- 自動記述の忠実性と客観性を評価し、特に身元追跡、行動の詳細、および事実の捏造(ハリュシネーション)の観点から検証する。
実験結果
リサーチクエスチョン
- RQ1高品質な監視映像のテキスト記述が与えられた場合、大規模言語モデルは高い正確性でゼロショットで犯罪検出を実行できるか?
- RQ2自動化された動画からテキストへの手法と、人間がアノテートした記述は、LLMベースの犯罪推論を支援する点でどのように比較できるか?
- RQ3自動化された動画からテキストへのパイプラインにどのような具体的な欠陥があり、LLMによる信頼できる犯罪検出を妨げているか?
- RQ4自動記述におけるハリュシネーション、詳細の不足、身元追跡の失敗が、LLMの性能をどの程度劣化させるか?
- RQ5現在のマルチモーダルまたはビジョン・ランゲージモデルは、客観的で透明性があり、正確な犯罪検出に適した記述を生成できるか?
主な発見
- GPT-4は、高品質で人が手作業でアノテートした動画記述が与えられた場合、ゼロショット犯罪検出で最先端の性能を達成した。
- 画像キャプションやLLMベースのビジョンモデルを含む自動化された動画からテキストへの手法は、被験者の身元や行動の明確な特定といった、推論に不可欠な重要な詳細が欠落した記述を生成した。
- オブジェクト追跡システムは時間経過にわたる身元の一貫性を維持できず、'person 3' や 'person 5' といった混乱を招く参照を生じさせ、犯罪的意図に関する時間的推論を困難にした。
- LLMベースのビジョンモデルは、実際に活動がなかったにもかかわらず「グループがプールをしていた」と誤って記述するなど、行動やオブジェクトを捏造する傾向があり、バイアスと不正確さを引き起こした。
- COCOオブジェクト検出データセットに武器が欠落しているため、モデルが暴力的犯罪を検出する能力が制限されており、現在のベンチマークにおいて重要なデータギャップが浮き彫りになった。
- 強力なLLMの推論能力にもかかわらず、全体のシステムは実際には失敗している。これは『ゴミをいれればゴミが出てくる』(garbage in, garbage out)という問題に起因し、自動記述の品質が低すぎるため、信頼できる犯罪検出を支援できない。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。