[论文解读] Where, What, Whether: Multi-modal Learning Meets Pedestrian Detection
该论文提出W3 Net,一种新颖的无锚点行人检测框架,将检测任务分解为三个部分:Where(通过鸟瞰图实现定位)、What(由深度引导的尺度预测)和Whether(利用共享视觉-语料嵌入进行分类以过滤误检)。该方法在Citypersons数据集的严重遮挡子集上将漏检率降低至18.7%(此前最先进方法为49.3%),实现两倍的性能提升。
Pedestrian detection benefits greatly from deep convolutional neural networks (CNNs). However, it is inherently hard for CNNs to handle situations in the presence of occlusion and scale variation. In this paper, we propose W$^3$Net, which attempts to address above challenges by decomposing the pedestrian detection task into extbf{ extit{W}}here, extbf{ extit{W}}hat and extbf{ extit{W}}hether problem directing against pedestrian localization, scale prediction and classification correspondingly. Specifically, for a pedestrian instance, we formulate its feature by three steps. i) We generate a bird view map, which is naturally free from occlusion issues, and scan all points on it to look for suitable locations for each pedestrian instance. ii) Instead of utilizing pre-fixed anchors, we model the interdependency between depth and scale aiming at generating depth-guided scales at different locations for better matching instances of different sizes. iii) We learn a latent vector shared by both visual and corpus space, by which false positives with similar vertical structure but lacking human partial features would be filtered out. We achieve state-of-the-art results on widely used datasets (Citypersons and Caltech). In particular. when evaluating on heavy occlusion subset, our results reduce MR$^{-2}$ from 49.3$\%$ to 18.7$\%$ on Citypersons, and from 45.18$\%$ to 28.33$\%$ on Caltech.
研究动机与目标
- 解决行人检测中持续存在的遮挡与尺度变化挑战,这些挑战在真实场景中严重影响性能。
- 通过采用无锚点范式,克服基于锚点检测器的冗余提议和锚点设计僵化等局限性。
- 通过利用鸟瞰图最小化因遮挡导致的可见性损失,提升对遮挡行人的定位鲁棒性。
- 通过建模深度与尺度之间的相互依赖关系,提升尺度预测精度,避免固定锚点比例的限制。
- 通过学习共享的视觉-语料表征用于分类,减少与具有相似垂直结构的非行人物体产生的误检。
提出的方法
- 从前视图图像生成鸟瞰图,以提供对遮挡具有鲁棒性的定位能力,从而更可靠地检测部分可见的行人。
- 建模深度与尺度之间的关系,以在不同图像位置生成由深度引导的自适应尺度,提升对不同大小行人的匹配准确性。
- 引入一个共享的潜在向量空间,同时编码视觉特征与语义语料线索(如头部、躯干、四肢),实现对遮挡与非遮挡行人统一的表征。
- 将检测任务解耦为三个独立的分支:'Where'用于定位,'What'用于尺度预测,'Whether'用于分类,分类使用共享的语料-视觉嵌入。
- 使用前视图特征进行候选框生成与分类,同时利用鸟瞰图进行定位与尺度预测,最大化跨模态间的互补信息。
- 端到端训练,采用多任务损失函数,整合定位、尺度与分类目标,同时在不增加额外卷积或全连接层的前提下保持计算效率。
实验结果
研究问题
- RQ1与仅使用前视图检测相比,鸟瞰图是否能显著提升在遮挡情况下的行人定位鲁棒性?
- RQ2建模深度与尺度之间的相互依赖关系,是否能带来比固定锚点比例更准确、更自适应的尺度预测?
- RQ3共享的视觉-语料嵌入空间是否能有效统一遮挡与非遮挡行人的特征表征,从而减少误检?
- RQ4所提出的多模态、多任务框架在Citypersons和Caltech等挑战性基准上的表现,相较于现有基于锚点与无锚点的检测器,优势有多大?
- RQ5尽管使用多模态输入,该方法是否仍具备计算效率,能否保持实时推理能力?
主要发现
- 在Citypersons数据集中,W3 Net将严重遮挡子集的漏检率(MR)从49.3%(此前最先进水平)降低至18.7%,实现两倍性能提升。
- 在Caltech数据集中,模型在非遮挡(Reasonable)子集上达到3.82%的漏检率,优于此前方法(包括OR-CNN和RepLoss)。
- 在小尺度行人(Far子集)上,模型性能相比专为该场景设计的TLL方法提升16.98%。
- 该方法在单张GTX 1080Ti上保持了具有竞争力的推理速度,在不增加额外卷积或全连接层的前提下实现了最先进精度。
- 鸟瞰图定位与语料-视觉嵌入的结合,在Caltech 'Occluded'子集上实现了51.05%的F1分数,优于FasterRCNN+ATT与MS-CNN等方法。
- IoU性能显著提升,更高比例的检测结果达到IoU > 0.5,表明定位精度更高。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。