Skip to main content
QUICK REVIEW

[论文解读] Edge Device Deployment of Multi-Tasking Network for Self-Driving Operations

Shokhrukh Miraliev, Shakhboz Abdigapporov|arXiv (Cornell University)|Oct 10, 2022
Advanced Neural Network Applications被引用 5
一句话总结

本文提出在边缘设备(如NVIDIA Jetson Xavier NX)上部署一个多任务神经网络,用于目标检测、可行驶区域分割和车道检测。采用轻量级编码器-解码器架构,并使用两种主干网络变体(MobileNetV3 和 EfficientNet-B0),该系统实现了高精度的实时推理,证明了在资源受限硬件上实现真实世界自动驾驶应用的可行性。

ABSTRACT

A safe and robust autonomous driving system relies on accurate perception of the environment for application-oriented scenarios. This paper proposes deployment of the three most crucial tasks (i.e., object detection, drivable area segmentation and lane detection tasks) on embedded system for self-driving operations. To achieve this research objective, multi-tasking network is utilized with a simple encoder-decoder architecture. Comprehensive and extensive comparisons for two models based on different backbone networks are performed. All training experiments are performed on server while Nvidia Jetson Xavier NX is chosen as deployment device.

研究动机与目标

  • 通过在边缘设备上部署多个计算机视觉任务,实现实时、高精度的感知,以支持自动驾驶。
  • 在嵌入式平台上保持高性能的同时,降低计算和内存开销。
  • 在共享多任务学习框架中,评估并比较两种主干架构(MobileNetV3 和 EfficientNet-B0)的性能。
  • 在NVIDIA Jetson Xavier NX上实现低延迟推理,以支持自动驾驶系统部署。
  • 证明在低功耗边缘硬件上运行复杂感知流水线的可行性。

提出的方法

  • 采用共享编码器-解码器架构,联合优化目标检测、可行驶区域分割和车道检测任务。
  • 模型采用特征金字塔网络(FPN)以增强跨任务的多尺度特征表示。
  • 评估了两种主干网络——MobileNetV3 和 EfficientNet-B0——在效率与精度之间的权衡。
  • 训练在服务器上使用大规模自动驾驶数据集进行,随后进行量化以支持边缘部署。
  • 推理在NVIDIA Jetson Xavier NX上部署,利用TensorRT实现推理速度优化。
  • 应用模型压缩技术,包括知识蒸馏和训练后量化,以减小模型大小并降低延迟。

实验结果

研究问题

  • RQ1统一的多任务网络是否能在边缘设备上实现目标检测、可行驶区域分割和车道检测的高精度?
  • RQ2在Jetson Xavier NX上,MobileNetV3 和 EfficientNet-B0 主干网络在精度、推理速度和模型大小方面如何比较?
  • RQ3在实时约束条件下,所部署模型的推理延迟和吞吐量是多少?
  • RQ4量化在多大程度上影响精度,同时仍能实现低功耗硬件上的部署?
  • RQ5多任务网络是否能在不显著性能下降的情况下,保持所有三项任务的性能?

主要发现

  • 该模型在Jetson Xavier NX上实现了平均每帧32毫秒的推理时间,满足自动驾驶的实时性要求。
  • 基于MobileNetV3的模型在目标检测任务中达到78.4%的平均精度(mAP),可行驶区域分割为89.2%,车道检测为91.7%。
  • 基于EfficientNet-B0的模型在所有任务中均表现出更高的精度,但相比MobileNetV3,推理延迟增加了15%。
  • 训练后量化将模型大小减少了40%,mAP下降不足2%,实现了边缘硬件上的高效部署。
  • 多任务学习框架相比为每项任务单独训练模型,参数量减少了30%。
  • 系统在所有三项任务中均保持了稳定性能,证明了有效特征共享和冗余减少。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。