[论文解读] ALERT: Accurate Learning for Energy and Timeliness
ALERT 是一种跨栈运行时调度器,通过联合优化深度神经网络(DNN)模型选择与系统资源配置,以满足动态的延迟、精度和能效约束。通过使用基于卡尔曼滤波的概率模型来检测环境波动,它协调应用级与系统级的自适应行为,在仅比理想基准系统多消耗3%能效、多产生2%推理错误的情况下,相比未协调的方法,实现了13%更低的能耗和27%更少的推理错误。
An increasing number of software applications incorporate runtime Deep Neural Networks (DNNs) to process sensor data and return inference results to humans. Effective deployment of DNNs in these interactive scenarios requires meeting latency and accuracy constraints while minimizing energy, a problem exacerbated by common system dynamics. Prior approaches handle dynamics through either (1) system-oblivious DNN adaptation, which adjusts DNN latency/accuracy tradeoffs, or (2) application-oblivious system adaptation, which adjusts resources to change latency/energy tradeoffs. In contrast, this paper improves on the state-of-the-art by coordinating application- and system-level adaptation. ALERT, our runtime scheduler, uses a probabilistic model to detect environmental volatility and then simultaneously select both a DNN and a system resource configuration to meet latency, accuracy, and energy constraints. We evaluate ALERT on CPU and GPU platforms for image and speech tasks in dynamic environments. ALERT's holistic approach achieves more than 13% energy reduction, and 27% error reduction over prior approaches that adapt solely at the application or system level. Furthermore, ALERT incurs only 3% more energy consumption and 2% higher DNN-inference error than an oracle scheme with perfect application and system knowledge.
研究动机与目标
- 解决在不可预测的系统条件下,满足DNN推理中动态延迟、精度和能效约束的挑战。
- 克服以往方法仅孤立地在应用层或系统层进行自适应的局限性。
- 实现DNN模型与系统资源配置之间的整体性、协同式运行时自适应,以提升整体系统效率。
- 在减少能耗和推理错误的同时,最小化约束违规(如错过截止时间)现象,适用于真实世界中的动态环境。
- 在动态、资源共享的工作负载中,以极低的运行时开销,实现接近理想基准系统的能效与精度表现。
提出的方法
- 基于卡尔曼滤波的概率模型,用于估计并跟踪在不同DNN模型与系统配置下推理延迟的分布。
- 引入全局减速因子以建模系统范围内的环境波动,实现对所有DNN与资源配置组合的联合延迟预测。
- 采用多目标优化策略,同时选择最优的DNN模型与系统资源配置,以满足用户定义的约束条件。
- 利用延迟估计的均值与方差,以应对系统波动性,提升自适应的鲁棒性。
- 支持传统DNN与Anytime DNN,实现在推理过程中动态调整精度与延迟的权衡。
- 采用反馈控制机制,持续适应资源争用与输入动态等变化的系统条件。
实验结果
研究问题
- RQ1与孤立的应用层或系统层自适应相比,DNN模型与系统资源之间的协同自适应能否实现更优的能效、延迟与精度权衡?
- RQ2在资源争用条件下,基于方差感知估计的概率模型在预测动态系统行为方面的有效性如何?
- RQ3在真实工作负载中,联合选择DNN与系统配置在多大程度上可减少推理错误与能耗?
- RQ4在实际应用中,该系统对非高斯延迟分布的鲁棒性如何?
- RQ5在动态、资源共享的环境中,该方法能否以极低的运行时开销实现接近理想基准系统的性能?
主要发现
- 与仅在应用层或系统层进行自适应的先前方法相比,ALERT将能耗降低了超过13%。
- ALERT相比未协调的自适应方法,实现了27%更低的DNN推理错误率,显著提升了在动态约束下的精度表现。
- ALERT的能耗仅比具备完整应用与系统状态知识的理想基准系统高3%,推理错误率仅高2%。
- ALERT的概率化设计(同时利用延迟估计的均值与方差)优于仅依赖均值预测的简化模型。
- ALERT对非高斯延迟分布表现出强鲁棒性,在延迟波动偏离高斯假设时仍能保持高精度。
- 由于采用全局减速因子模型,ALERT实现了快速响应——自适应延迟仅为单次输入周期,从而实现对所有配置的同步预测。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。