Skip to main content
QUICK REVIEW

[論文レビュー] VLPD: Context-Aware Pedestrian Detection via Vision-Language Semantic Self-Supervision

Mengyin Liu, Jie Jiang|arXiv (Cornell University)|Apr 6, 2023
Video Surveillance and Tracking Methods被引用数 6
ひとこと要約

本稿では、視覚言語自己教師あり手法であるVLPDを提案する。この手法は、CLIPに基づくクロスモodalマッピングを活用して文脈的対象の擬似意味的ラベルを生成し、人的アノテーションを一切用いずに明示的な意味的文脈モデリングを可能にする、文脈に配慮した歩行者検出のためのものである。自己教師あり視覚言語意味的(VLS)セグメンテーションとプロトタイプベース意味的対照的(PSC)学習を組み合わせることで、CityPersonsおよびCaltechベンチマークにおいて最先端の性能を達成し、特に小規模および重度に隠蔽された歩行者の検出において優れた性能を発揮する。

ABSTRACT

Detecting pedestrians accurately in urban scenes is significant for realistic applications like autonomous driving or video surveillance. However, confusing human-like objects often lead to wrong detections, and small scale or heavily occluded pedestrians are easily missed due to their unusual appearances. To address these challenges, only object regions are inadequate, thus how to fully utilize more explicit and semantic contexts becomes a key problem. Meanwhile, previous context-aware pedestrian detectors either only learn latent contexts with visual clues, or need laborious annotations to obtain explicit and semantic contexts. Therefore, we propose in this paper a novel approach via Vision-Language semantic self-supervision for context-aware Pedestrian Detection (VLPD) to model explicitly semantic contexts without any extra annotations. Firstly, we propose a self-supervised Vision-Language Semantic (VLS) segmentation method, which learns both fully-supervised pedestrian detection and contextual segmentation via self-generated explicit labels of semantic classes by vision-language models. Furthermore, a self-supervised Prototypical Semantic Contrastive (PSC) learning method is proposed to better discriminate pedestrians and other classes, based on more explicit and semantic contexts obtained from VLS. Extensive experiments on popular benchmarks show that our proposed VLPD achieves superior performances over the previous state-of-the-arts, particularly under challenging circumstances like small scale and heavy occlusion. Code is available at https://github.com/lmy98129/VLPD.

研究の動機と目的

  • 人間のような物体や隠蔽・小規模な歩行者が複雑な都市環境に存在する場合に生じる誤検出や検出漏れの課題に対処すること。
  • 高価な人的アノテーションに依存するか、または暗黙的なローカル文脈モデリングに依存する従来の文脈に配慮した検出器の限界を克服すること。
  • 視覚言語モデルを用いた自己教師あり学習により、追加のアノテーションが不要な明示的で意味的認識可能な文脈理解を可能にすること。
  • 意味的認識可能な特徴に基づくプロトタイプベースの対照的学習を活用して、歩行者と混乱をきたす文脈的要素(例:信号機、電柱)との識別を高めること。

提案手法

  • 視覚言語モデル(例:CLIP)のクロスモダリティマッピングを用いて文脈的対象の擬似意味的ラベルを生成する自己教師あり視覚言語意味的(VLS)セグメンテーション手法を提案し、歩行者検出と意味的セグメンテーションの共同学習を可能にする。
  • CLIPの視覚言語アライメントを活用して、ピクセル単位の特徴を意味的クラス(例:「信号機」、「電柱」)の言語埋め込みにマッピングし、人的アノテーションなしに文脈的対象の擬似ラベルを生成する。
  • ピクセル単位の歩行者特徴をクエリとみなし、VLSで予測された文脈意味に従って、正例の意味的クラス(例:「人物」)のプロトタイプに引き寄せ、負例(例:「信号機」、「電柱」)のプロトタイプから遠ざける、プロトタイプベース意味的対照的(PSC)学習を導入する。
  • クラス固有のプロトタイプをピクセル単位の集約によって計算し、明示的な意味的手がかりを用いて歩行者と文脈的対象の間でグローバルに識別を高める。
  • 境界ボックス予測のための検出損失(例:Faster R-CNN損失)と自己教師ありセグメンテーションおよび対照的学習損失を組み合わせたマルチタスク損失を用いて、エンドツーエンドでモデルを訓練する。
  • 初期化のための事前学習済みCLIPを視覚エンコーダとして活用し、擬似ラベル生成時にゼロショット転送が可能になるようにする。

実験結果

リサーチクエスチョン

  • RQ1人的アノテートされた文脈データがなくても、視覚言語モデルを効果的に活用して歩行者検出のための意味的文脈ラベルを生成できるか?
  • RQ2明示的な意味的文脈モデリングは、小規模または重度に隠蔽された歩行者といった困難な状況での検出性能を向上させられるか?
  • RQ3プロトタイプベースの対照的学習は、シーン内の混乱をきたす非人間的対象との識別を高められるか?
  • RQ4視覚言語アライメントによる自己教師あり文脈モデリングは、弱教師ありまたは潜在的文脈表現に依存する従来手法を上回る性能を発揮するか?

主な発見

  • VLPDはCityPersonsベンチマークで新たな最先端性能を達成し、Reasonableサブセットでは9.4%、Smallサブセットでは10.9%の誤差率を低下させ、SMPD や EGCL などの先行手法を上回った。
  • Caltechベンチマークでは、Reasonableサブセットで2.3%、Heavy Occlusionサブセットで37.7%の誤差率を達成し、追加のアノテーションを用いるPedHunter や DMSFLN よりも優れた性能を示した。
  • 特に困難なサブセット—特に重度の隠蔽(CityPersonsのHOサブセットで34.9%の誤差率)および小規模検出(10.9%誤差率)—において顕著に性能向上を示し、スケールおよび隠蔽に対する強靭性を示した。
  • アブレーションスタディの結果、VLSおよびPSCの両コンponentsが不可欠であることが確認され、VLSが正確な意味的文脈ラベリングを提供し、PSCが特徴の識別能を向上させた。
  • VLPDは人的アノテートされた文脈ラベルを一切使用せず、視覚言語自己教師あり学習による文脈モデリングの有効性を実証した。
  • モデルはベンチマーク間で良好な一般化性能を示し、CityPersonsおよびCaltechの両方で強力な性能を維持しており、提案された自己教師ありフレームワークの転送可能性と強靭性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。