[论文解读] ApproxNet: Content and Contention-Aware Video Analytics System for Embedded Clients
ApproxNet 是一种用于嵌入式设备的动态、内容感知与竞争感知的视频对象分类系统,采用单一深度神经网络(DNN),并配备两个运行时近似控制参数——输入分辨率和网络深度,可实时适应内容复杂度和资源竞争的变化。该系统在边缘设备上实现了低且稳定的推理延迟(30 fps),相较于 ResNet、MCDNN、MobileNets、NestDNN 和 MSDNet,准确率和延迟表现更优。
Videos take a lot of time to transport over the network, hence running analytics on the live video on embedded or mobile devices has become an important system driver. Considering that such devices, e.g., surveillance cameras or AR/VR gadgets, are resource constrained, creating lightweight deep neural networks (DNNs) for embedded devices is crucial. None of the current approximation techniques for object classification DNNs can adapt to changing runtime conditions, e.g., changes in resource availability on the device, the content characteristics, or requirements from the user. In this paper, we introduce ApproxNet, a video object classification system for embedded or mobile clients. It enables novel dynamic approximation techniques to achieve desired inference latency and accuracy trade-off under changing runtime conditions. It achieves this by enabling two approximation knobs within a single DNN model, rather than creating and maintaining an ensemble of models (e.g., MCDNN [MobiSys-16]. We show that ApproxNet can adapt seamlessly at runtime to these changes, provides low and stable latency for the image and video frame classification problems, and show the improvement in accuracy and latency over ResNet [CVPR-16], MCDNN [MobiSys-16], MobileNets [Google-17], NestDNN [MobiCom-18], and MSDNet [ICLR-18].
研究动机与目标
- 解决在资源受限的嵌入式与移动设备上运行实时视频分析的挑战,因为当前最先进的 DNN 模型计算开销过大。
- 克服现有近似技术在动态运行时条件(如内容复杂度变化和资源竞争)下缺乏适应性的局限。
- 实现无缝的运行时自适应,以维持低且稳定的推理延迟(例如 30 fps),同时平衡准确率与计算成本。
- 通过在单一 DNN 架构中嵌入两个近似控制参数——输入分辨率和网络深度——消除维护多个模型(如模型集成)的需求。
- 为设备端视频分析提供一种实用的端到端解决方案,能够响应内容和系统负载的实时变化,而无需依赖云端或边缘计算卸载。
提出的方法
- 在单一 DNN 模型中集成两种近似控制参数——输入分辨率缩放与中间层提前退出——以实现推理的动态自适应。
- 采用内容感知机制,在内容较简单时下采样输入帧,从而降低计算负载,同时保持准确率。
- 应用竞争感知的运行时监控机制,根据实时资源可用性(如 CPU/GPU 负载、内存带宽)调整近似级别。
- 利用预测模型估算推理延迟与准确率之间的权衡,评估分辨率与深度调整对每帧的影响。
- 基于内容复杂度与系统竞争情况,动态选择每帧的最优近似级别,确保端到端延迟 SLO 得到满足。
- 利用统一的 DNN 架构支持多种推理路径(不同输入尺寸与网络深度),避免模型切换或集成管理的开销。
实验结果
研究问题
- RQ1单一 DNN 模型能否基于实时内容特征与系统资源竞争情况,动态调整其推理策略,以维持低且稳定的延迟?
- RQ2输入分辨率缩放与提前退出的结合在嵌入式设备上,能否有效实现推理延迟与分类准确率之间的平衡权衡?
- RQ3在不同运行时条件下,ApproxNet 相较于现有最先进模型(如 ResNet、MCDNN、MobileNets)在延迟与准确率方面表现如何?
- RQ4ApproxNet 是否能在无需预训练模型集成的情况下,保持在各类视频内容类型(简单帧 vs. 复杂帧)下的稳定性能?
- RQ5该系统的自适应近似机制在实际视频处理过程中,面对设备工作负载与资源可用性的动态变化,如何响应?
主要发现
- ApproxNet 在 NVIDIA Jetson TX2 等嵌入式设备上实现了稳定的 30 fps 推理延迟,显著优于 ResNet(每帧 101 ms)和 MCDNN,后者需依赖云端或边缘计算支持。
- 与 MobileNets 相比,系统将推理延迟降低最多 40%;与 MCDNN 相比,延迟降低最多 30%,同时在复杂视频帧上保持或提升准确率。
- 通过在需要时利用更深的推理路径,ApproxNet 在复杂帧上的准确率相比 MCDNN 和 NestDNN 最高提升 12%。
- 基于内容与竞争感知的动态自适应机制减少了对模型集成的需求,消除了维护多个模型所带来的内存与计算开销。
- ApproxNet 在多样化视频内容中表现出强鲁棒性,能以低分辨率输入正确分类简单帧,以完整深度推理准确分类复杂帧,确保性能一致。
- 系统用于延迟-准确率权衡的预测模型支持低运行时开销的实时决策,适用于实时增强现实/虚拟现实与监控等应用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。