[论文解读] Exploration of Optimized Semantic Segmentation Architectures for edge-Deployment on Drones
本文提出使用ImageNet预训练权重的FPN-EfficientNetB3作为无人机边缘部署的最优语义分割架构,在DroneDeploy数据集上实现了0.65的mIoU和0.71的F1分数。通过使用TensorRT和FP16精度进行硬件感知的模型优化,相较于基于InceptionResNetV2的模型,内存使用量减少4.1倍,推理延迟降低10%,实现了边缘设备上的高效实时处理。
In this paper, we present an analysis on the impact of network parameters for semantic segmentation architectures in context of UAV data processing. We present the analysis on the DroneDeploy Segmentation benchmark. Based on the comparative analysis we identify the optimal network architecture to be FPN-EfficientNetB3 with pretrained encoder backbones based on Imagenet Dataset. The network achieves IoU score of 0.65 and F1-score of 0.71 over the validation dataset. We also compare the various architectures in terms of their memory footprint and inference latency with further exploration of the impact of TensorRT based optimizations. We achieve memory savings of ~4.1x and latency improvement of 10% compared to Model: FPN and Backbone: InceptionResnetV2.
研究动机与目标
- 识别在计算资源有限的无人机上实现实时部署的最准确且高效的语义分割架构。
- 在多类别无人机数据集上基准测试标准与新型分割模型,重点关注准确率、内存占用和推理延迟之间的权衡。
- 评估模型量化(FP16)和TensorRT优化对边缘部署中模型效率和推理速度的影响。
- 建立针对无人机平台定制的软硬件协同优化框架,用于语义分割。
- 首次展示基于EfficientNet的架构在遥感与无人机应用中的可行性与性能。
提出的方法
- 本研究在DroneDeploy数据集上评估了多种分割架构(FPN、PSPNet、UNet、LinkNet)及其多样化主干网络(MobileNetV2、InceptionResNetV2、EfficientNetB3)。
- 模型使用AdamW优化器和余弦退火学习率调度器进行训练,并对比了ImageNet预训练与随机初始化的效果。
- 研究采用300×300和384×384的裁剪数据增强策略,以确保训练图像块中各类别的充分表示。
- 通过TensorRT优化和FP16精度提升推理效率,减小模型尺寸并加速边缘硬件上的推理过程。
- 在多个边缘设备(包括NVIDIA Jetson Nano和RTX 2080 Ti)上对内存使用量和推理延迟进行了性能分析。
- 消融研究评估了编码器微调、权重初始化和学习率调度对模型性能的影响。
实验结果
研究问题
- RQ1哪种语义分割架构在无人机边缘部署中能实现准确率、内存占用和推理延迟的最佳平衡?
- RQ2在无人机分割任务中,ImageNet预训练与随机初始化相比,性能表现如何?
- RQ3基于TensorRT的优化在多大程度上减少了边缘设备上分割模型的内存消耗和推理延迟?
- RQ4不同主干网络架构(如MobileNetV2、InceptionResNetV2、EfficientNetB3)对无人机分割中模型效率和准确率有何影响?
- RQ5FP16精度和学习率调度对模型收敛性及推理性能有何影响?
主要发现
- 使用ImageNet预训练权重的FPN-EfficientNetB3模型在DroneDeploy数据集上达到最高的验证mIoU(0.65)和F1分数(0.71)。
- ImageNet预训练显著优于随机初始化,挑战了遥感领域中关于领域特定权重初始化的既有假设。
- 在TensorRT优化后,FPN-EfficientNetB3相比FPN-InceptionResNetV2基线模型,内存使用量减少4.1倍,推理延迟降低10%。
- FP16量化在保持模型准确率的同时,实现了显著的内存节省和速度提升,验证了其在边缘优化推理中的适用性。
- 基于InceptionResNetV2的模型比EfficientNetB3模型重4倍,尽管准确率较高,但并不适合轻量化边缘部署。
- NVIDIA Jetson Nano被确定为最适合部署的边缘设备,因其具备有利的延迟和内存表现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。