[论文解读] GEMEL: Model Merging for Memory-Efficient, Real-Time Video Analytics at the Edge
GEMEL 引入了模型合并技术,这是一种内存高效的方案,通过在边缘视觉模型之间共享架构相同的层,以减少 GPU 内存使用量和交换开销。通过识别并微调共享层,GEMEL 在实时边缘视频分析中实现了高达 60.7% 的内存减少,以及 8–39% 的准确率提升。
Video analytics pipelines have steadily shifted to edge deployments to reduce bandwidth overheads and privacy violations, but in doing so, face an ever-growing resource tension. Most notably, edge-box GPUs lack the memory needed to concurrently house the growing number of (increasingly complex) models for real-time inference. Unfortunately, existing solutions that rely on time/space sharing of GPU resources are insufficient as the required swapping delays result in unacceptable frame drops and accuracy violations. We present model merging, a new memory management technique that exploits architectural similarities between edge vision models by judiciously sharing their layers (including weights) to reduce workload memory costs and swapping delays. Our system, GEMEL, efficiently integrates merging into existing pipelines by (1) leveraging several guiding observations about per-model memory usage and inter-layer dependencies to quickly identify fruitful and accuracy-preserving merging configurations, and (2) altering edge inference schedules to maximize merging benefits. Experiments across diverse workloads reveal that GEMEL reduces memory usage by up to 60.7%, and improves overall accuracy by 8-39% relative to time/space sharing alone.
研究动机与目标
- 解决由于模型复杂度增加和并发工作负载导致的边缘视频分析中 GPU 内存瓶颈日益严重的问题。
- 克服现有时间共享和空间共享策略的局限性,这些策略因高交换成本而导致帧丢失和准确率下降。
- 通过基于架构相似性的模型合并,减少内存占用,实现边缘设备上的高效实时推理。
- 开发一种可无缝集成到现有视频分析流水线中的系统,对调度和模型部署的改动极小。
提出的方法
- 识别视觉模型(如卷积块)之间架构相同但权重可能不同的层,这些层可在权重层面实现共享。
- 利用结构和依赖关系分析,检测可行的合并配置,在保持模型准确率的同时最小化内存占用。
- 采用微调策略重新训练共享层,以对齐不同模型中的权重,确保合并后准确率得以保持。
- 修改边缘推理调度策略,优先处理具有高合并潜力的工作负载,以最大化共享层的利用率。
- 利用各模型的内存使用模式和层间依赖关系,指导快速且准确的合并配置选择。
- 将合并逻辑集成到现有边缘推理流水线中,运行时开销极小,支持实时部署。
实验结果
研究问题
- RQ1在边缘推理中,视觉模型之间的架构相似性在多大程度上可被利用以减少内存使用?
- RQ2与传统的时分或空分共享策略相比,模型合并技术在减少 GPU 内存占用和交换延迟方面的效果如何?
- RQ3工作负载异构性(如不同模型、场景、目标)对合并效率和内存节省有何影响?
- RQ4在不造成显著准确率下降的前提下,该方法是否可跨不同模型族及其变体应用?
- RQ5GEMEL 的合并策略在混合模型类型和输入数据的多样化、真实世界视频分析工作负载中,其可扩展性如何?
主要发现
- 通过共享架构相同的层,GEMEL 在多样化视频分析工作负载中,将 GPU 内存使用量减少了高达 60.7%。
- 在双查询工作负载中,内存节省最高,中位数节省达到理想条件下最优值的 89–98%。
- 对于更大的工作负载(最多 5 个查询),在摄像头、目标或场景类型变化时,内存节省仅轻微下降(0–8%),表明其鲁棒性良好。
- 当模型类型变化时,内存节省下降 2–33%,主要由于层位置差异导致共享机会减少,但节省量依然显著。
- 与仅使用时分或空分共享相比,模型合并使整体准确率提升了 8–39%,主要归因于消除了因交换延迟导致的帧丢失。
- 当在同一系列的模型变体之间进行合并(如 VGG 或 ResNet 变体)时,该方法尤为有效,最多可实现 96.3% 的层共享。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。