[论文解读] Re-ranking Object Proposals for Object Detection in Automatic Driving
本文提出一种用于自动驾驶场景下目标候选框的类别特定重排序方法,结合语义分割、立体深度、上下文特征、基于CNN的物体性以及低级特征,以提升候选框质量。通过结构化SVM学习类别特定权重,显著提高召回率,尤其在严格IoU阈值下表现优异,仅使用1,000个候选框即实现当前最优检测性能,优于基线方法使用5,000个候选框的表现。
Object detection often suffers from a plenty of bootless proposals, selecting high quality proposals remains a great challenge. In this paper, we propose a semantic, class-specific approach to re-rank object proposals, which can consistently improve the recall performance even with less proposals. We first extract features for each proposal including semantic segmentation, stereo information, contextual information, CNN-based objectness and low-level cue, and then score them using class-specific weights learnt by Structured SVM. The advantages of the proposed model are twofold: 1) it can be easily merged to existing generators with few computational costs, and 2) it can achieve high recall rate uner strict critical even using less proposals. Experimental evaluation on the KITTI benchmark demonstrates that our approach significantly improves existing popular generators on recall performance. Moreover, in the experiment conducted for object detection, even with 1,500 proposals, our approach can still have higher average precision (AP) than baselines with 5,000 proposals.
研究动机与目标
- 解决自动驾驶场景中在严格IoU标准(如IoU > 0.7)下目标候选框方法召回率低的挑战。
- 在不修改现有方法架构的前提下,提升其生成的目标候选框质量。
- 通过显著减少候选框数量(如1,000个而非5,000个)实现高召回率与检测精度,降低计算成本。
- 提出一种类别特定的重排序策略,在复杂驾驶环境中优于类无关方法。
- 在多个目标检测基准上实现一致改进,尤其在KITTI数据集上对具有挑战性的类别(如汽车、骑行人、行人)表现突出。
提出的方法
- 为每个目标候选框提取多模态特征,包括语义分割(基于Cityscapes微调的DeepLab)、立体视差(使用Zbontar等人提出的CNN方法)、上下文信息、基于CNN的物体性(来自DeepBox)以及低级线索。
- 使用结构化SVM学习基于拼接特征向量的类别特定权重,以对候选框进行评分。
- 通过计算每个物体类别特征向量与学习到的权重之间的点积,对候选框进行重排序。
- 将重排序模块作为即插即用组件集成到任意现有目标候选框生成器中,计算开销极低。
- 将重排序后的候选框作为快速R-CNN检测器的输入,评估检测性能。
- 优化推理速度,在单核上实现每张图像0.79秒的处理速度,通过并行化具备实现实时性能的潜力。
实验结果
研究问题
- RQ1与类无关方法相比,类别特定重排序策略是否能在严格IoU阈值(如IoU > 0.7)下显著提升召回率?
- RQ2重排序在多大程度上可减少维持高检测精度所需的目标候选框数量?
- RQ3结合语义、立体、上下文及基于CNN的特征,对不同物体类别候选框质量有何影响?
- RQ4所提方法是否在KITTI基准上对多种候选框生成器(如3DOP、EdgeBoxes、Selective Search)均一致提升召回率与平均精度?
- RQ5使用更少数量的候选框(如1,000个)进行重排序后,是否能实现比未重排序但数量更多(如5,000个)候选框更高的平均精度?
主要发现
- Re-3DOP在仅使用1,000个候选框的情况下,对所有难度级别的汽车类实现了90%的召回率,优于使用5,000个候选框的3DOP。
- Re-EB在简单难度级别下,仅用1,000个候选框即在IoU=0.7时对三类物体(汽车、骑行人、行人)均达到80%的召回率。
- Re-3DOP使用1,000个候选框时平均精度(AP)达到88.34%,略高于3DOP使用5,000个候选框时的88.26% AP。
- Re-EB使用1,500个候选框时AP达到76.81%,优于EB使用5,000个候选框时的76.62% AP。
- Re-SS使用500个候选框时AP达到51.51%,与SS使用500个候选框时的51.43% AP相当,但仅需其1/4的候选框数量。
- 可视化结果表明,前100名候选框中的误报显著减少,Re-3DOP在去除无关区域方面优于3DOP。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。