[论文解读] FisheyeMultiNet: Real-time Multi-task Learning Architecture for Surround-view Automated Parking System
FisheyeMultiNet 是一种用于四只鱼眼摄像头的实时、多任务深度学习架构,专为全景自动泊车系统设计。它在低功耗嵌入式系统上以 15 fps 的速度联合执行目标检测、语义分割和污损检测,实现接近单任务性能的同时具备显著的计算效率,并发布了包含 5,000 张图像的公开数据集以促进研究。
Automated Parking is a low speed manoeuvring scenario which is quite unstructured and complex, requiring full 360° near-field sensing around the vehicle. In this paper, we discuss the design and implementation of an automated parking system from the perspective of camera based deep learning algorithms. We provide a holistic overview of an industrial system covering the embedded system, use cases and the deep learning architecture. We demonstrate a real-time multi-task deep learning network called FisheyeMultiNet, which detects all the necessary objects for parking on a low-power embedded system. FisheyeMultiNet runs at 15 fps for 4 cameras and it has three tasks namely object detection, semantic segmentation and soiling detection. To encourage further research, we release a partial dataset of 5,000 images containing semantic segmentation and bounding box detection ground truth via WoodScape project \cite{yogamani2019woodscape}.
研究动机与目标
- 开发一种基于鱼眼摄像头的实时、嵌入式多任务深度学习系统,用于自动泊车。
- 解决在非结构化泊车环境中,针对 360° 近场感知的低功耗、实时推理挑战。
- 通过融合视觉感知,提升在平行、垂直及模糊泊车场景下的鲁棒性与准确性。
- 发布一个包含 5,000 张鱼眼图像的公开数据集,附带语义分割和边界框标注,以推动自动泊车领域的研究。
- 证明多任务学习可在显著提升内存与计算效率的同时,实现接近单任务性能的表现。
提出的方法
- 设计一种统一的深度神经网络架构,对鱼眼摄像头输入联合执行目标检测、语义分割和污损检测。
- 采用基于梯度幅值动态任务加权的加权多任务损失函数(受 GradNorm 启发),以平衡各任务间差异显著的损失尺度。
- 通过通道剪枝、最小化跳跃连接以及限制水平线区域的分割解码,对网络进行嵌入式部署优化,以降低内存与计算开销。
- 使用从全球三个地区、多种车型(三厢车与 SUV)采集的 10,000 张图像内部数据集,按 6:1:3 的比例进行训练。
- 采用 Keras 深度学习框架,输入分辨率设为 1280×384,以在保持性能的同时满足内存约束。
- 通过 WoodScape 项目发布数据集中 5,000 张图像的子集,附带真实标注的语义分割与目标检测信息。
实验结果
研究问题
- RQ1单一深度学习模型是否能在低功耗嵌入式硬件上实时联合执行多个感知任务(目标检测、语义分割与污损检测)?
- RQ2与单任务网络相比,多任务学习在自动泊车感知中的准确率与效率表现如何?
- RQ3在嵌入式视觉系统中,哪些架构与优化策略最有效于降低多任务网络的内存与计算负载?
- RQ4共享主干网络在使用鱼眼摄像头实现 360° 泊车感知时,能在多大程度上提升性能与效率?
- RQ5基于梯度幅值的动态损失加权在异构感知任务的多任务学习中,如何提升收敛性与性能表现?
主要发现
- FisheyeMultiNet 在使用汽车级低功耗片上系统(SoC)处理四只鱼眼摄像头时,实现了 15 fps 的推理速度。
- 多任务学习(MTL)模型在语义分割任务上的平均交并比(mIoU)达到 0.7263,与单任务学习(STL)的 0.7350 相比仅出现微小下降,表明准确率损失极小。
- 在目标检测任务中,MTL 模型的平均精度均值(mAP)达到 0.4814,略高于单任务基线模型的 0.4737。
- 采用加权损失函数并设置 w_seg = 100 显著提升了所有数据集上的分割性能,证明了损失归一化的重要性。
- 通过架构优化(如通道剪枝与水平线受限的分割解码),模型有效降低了内存与计算负载,实现了实时部署。
- 作者发布了首个面向自动泊车领域的公开数据集,包含 5,000 张图像,附带语义分割与边界框标注。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。