[论文解读] Weakly Supervised Training of Monocular 3D Object Detectors Using Wide Baseline Multi-view Traffic Camera Data
本文提出一种弱监督方法,利用重叠的、基线较宽的多视角摄像头数据,对单目3D目标检测器进行微调,以实现交通路口监控。通过利用预训练检测器和一种多视角重投影损失,该方法在仅使用10分钟未标注多视角视频进行微调的情况下,实现了与最先进全监督模型相当的7自由度(7DoF)车辆位姿精度。
Accurate 7DoF prediction of vehicles at an intersection is an important task for assessing potential conflicts between road users. In principle, this could be achieved by a single camera system that is capable of detecting the pose of each vehicle but this would require a large, accurately labelled dataset from which to train the detector. Although large vehicle pose datasets exist (ostensibly developed for autonomous vehicles), we find training on these datasets inadequate. These datasets contain images from a ground level viewpoint, whereas an ideal view for intersection observation would be elevated higher above the road surface. We develop an alternative approach using a weakly supervised method of fine tuning 3D object detectors for traffic observation cameras; showing in the process that large existing autonomous vehicle datasets can be leveraged for pre-training. To fine-tune the monocular 3D object detector, our method utilises multiple 2D detections from overlapping, wide-baseline views and a loss that encodes the subjacent geometric consistency. Our method achieves vehicle 7DoF pose prediction accuracy on our dataset comparable to the top performing monocular 3D object detectors on autonomous vehicle datasets. We present our training methodology, multi-view reprojection loss, and dataset.
研究动机与目标
- 解决单目3D检测器在自车视角与高位路口监控摄像头之间的领域差距问题。
- 在无需昂贵激光雷达或人工3D标注的情况下,实现在城市路口的准确7DoF车辆位姿估计(位置、尺寸、偏航角)。
- 开发一种弱监督训练方法,仅使用2D检测结果和多视角间几何一致性作为监督信号。
- 发布一个新的多视角数据集(WIBAM),包含4.5万个自动标注的车辆和1,651个手工标注的7DoF位姿,用于评估。
- 证明在10分钟多视角视频上进行微调,即可实现与全监督SOTA模型性能相当的结果。
提出的方法
- 使用弱监督多视角重投影损失对预训练的单目3D目标检测器进行微调。
- 利用重叠的、基线较宽的摄像头视角,通过预训练的2D检测器生成2D检测结果作为弱监督信号。
- 通过最小化多视角间3D检测结果的重投影误差,强制实现几何一致性。
- 利用预训练模型的3D预测头初始化检测器,减少对大规模3D标注数据的需求。
- 在端到端训练过程中应用该损失,联合优化3D边界框预测与几何一致性。
- 使用多视角标注工具创建手工标注的测试集用于评估,确保性能测量的可靠性。
实验结果
研究问题
- RQ1能否有效微调在自车视角数据上预训练的单目3D目标检测器,以适应高位路口监控摄像头?
- RQ2在缺乏3D标注的情况下,多视角间的几何一致性能否作为强监督信号?
- RQ3需要多少多视角数据才能实现与全监督模型相当的性能?
- RQ4该弱监督方法能否显著减少交通安防研究中昂贵的人工3D标注需求?
- RQ5在真实路口数据上,该方法是否能显著提升基线模型的7DoF位姿精度?
主要发现
- WIBAM模型在WIBAM测试集上的7DoF位姿预测精度,与NuScenes数据集上最先进全监督模型的性能相当。
- 在WIBAM测试集上,2D检测误差(ATE)降低至0.41m,3D尺寸误差(ASE)降低至0.22m,偏航角误差(AOE)降低至4.69°。
- 仅使用12.5 FPS多视角数据中10分钟的视频片段,即可提供足够监督信号,显著提升基线模型的3D IoU性能。
- 定性结果表明,即使在车辆被遮挡或截断的情况下,模型仍能长时间保持一致且准确的3D边界框预测。
- 多视角重投影损失能有效校正预训练模型在新摄像头视角下引入的定位与尺寸误差。
- WIBAM数据集包含45,000个自动标注的车辆(116,000个2D边界框)和1,651个手工标注的7DoF位姿,支持可复现的评估。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。