[论文解读] Scene Understanding for Autonomous Driving
本文在自动驾驶场景理解的 KITTI-MOTS 和 MOTSChallenge 数据集上评估了 Detectron2 中的 RetinaNet、Faster R-CNN 和 Mask R-CNN。在特定领域数据上微调以及超参数优化显著提升了实例分割的准确率,其中 Mask R-CNN 经过调优后达到 60.54% 的平均掩码 AP,表明模型性能对数据集构成和配置高度敏感。
To detect and segment objects in images based on their content is one of the most active topics in the field of computer vision. Nowadays, this problem can be addressed using Deep Learning architectures such as Faster R-CNN or YOLO, among others. In this paper, we study the behaviour of different configurations of RetinaNet, Faster R-CNN and Mask R-CNN presented in Detectron2. First, we evaluate qualitatively and quantitatively (AP) the performance of the pre-trained models on KITTI-MOTS and MOTSChallenge datasets. We observe a significant improvement in performance after fine-tuning these models on the datasets of interest and optimizing hyperparameters. Finally, we run inference in unusual situations using out of context datasets, and present interesting results that help us understanding better the networks.
研究动机与目标
- 评估最先进实例分割模型——RetinaNet、Faster R-CNN 和 Mask R-CNN——在自动驾驶数据集上的性能。
- 分析在 KITTI-MOTS 和 MOTSChallenge 上微调对检测与分割准确率的提升效果,相较于预训练模型。
- 研究超参数调优(学习率调度器、冻结阶段、IoU 阈值、NMS)对模型性能的影响。
- 探索模型在上下文外或异常场景下的行为,以理解网络实际学习到的特征。
提出的方法
- 使用 Detectron2 在 KITTI-MOTS 和 MOTSChallenge 数据集上训练并评估了 RetinaNet、Faster R-CNN 和 Mask R-CNN。
- 通过在特定领域数据上微调预训练模型,应用迁移学习以提升自动驾驶场景下的性能。
- 优化关键超参数:采用 One-Cycle 学习率调度器,调整 ResNet 主干网络的冻结阶段数量,调节背景/前景 IoU 阈值,并测试不同 NMS 阈值。
- 在上下文外数据集上进行定性推理,以分析模型在罕见或未见场景下的鲁棒性与泛化能力。
- 使用交叉验证划分中的平均精确率(mAP)量化性能,结果按模型及配置分别报告。
- 使用 COCO、Cityscapes、KITTI-MOTS 和 MOTSChallenge 作为训练数据源,评估数据集构成对模型行为的影响。
实验结果
研究问题
- RQ1在 KITTI-MOTS 和 MOTSChallenge 上微调如何提升预训练的 RetinaNet、Faster R-CNN 和 Mask R-CNN 模型的实例分割性能?
- RQ2在自动驾驶数据集上,Mask R-CNN 的最优超参数配置(学习率调度器、冻结阶段、IoU 阈值、NMS)是什么?
- RQ3不同训练数据构成(如 COCO + KITTI-MOTS 与 COCO + Cityscapes + MOTSChallenge)如何影响检测准确率与泛化能力?
- RQ4在上下文外数据集上测试模型能获得哪些洞见?这些测试如何揭示网络的真实归纳偏置?
主要发现
- 在 KITTI-MOTS 和 MOTSChallenge 数据集上微调显著提升了模型性能,其中 Mask R-CNN 经过超参数优化后达到 60.54% 的平均掩码 AP。
- One-Cycle 学习率调度器将训练迭代次数减少了 60%,同时保持或提升了性能,因此成为最优选择。
- 冻结 ResNet 主干网络的两个阶段可获得最佳 mAP(46.80%),进一步冻结更多阶段则导致性能下降,表明归纳偏置与微调能力之间存在权衡。
- 使用默认 IoU 阈值(背景为 0.3,前景为 0.7)时 mAP 最高(60.54%),偏离默认值会降低性能。
- NMS 阈值设为 0.7 时 mAP 最佳(46.80%),将其提高至 0.9 略微改善结果(47.34%),表明更高的重叠阈值有助于合并冗余检测。
- 出人意料的是,引入仅包含行人标注的 MOTSChallenge 数据集,反而提升了复杂场景中对车辆的检测性能,表明模型泛化能力可能受益于类别无关或弱监督数据。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。