[论文解读] Adaptive Streaming Perception using Deep Reinforcement Learning.
本文提出了一种深度强化学习方法,通过实时联合平衡准确率与延迟,优化流媒体感知。该方法将权衡问题建模为具有统一奖励函数的上下文Bandit问题,使智能体能够学习到一种优于最先进方法的策略,在公开数据集上表现优异。
Executing computer vision models on streaming visual data, or streaming perception is an emerging problem, with applications in self-driving, embodied agents, and augmented/virtual reality. The development of such systems is largely governed by the accuracy and latency of the processing pipeline. While past work has proposed numerous approximate execution frameworks, their decision functions solely focus on optimizing latency, accuracy, or energy, etc. This results in sub-optimum decisions, affecting the overall system performance. We argue that the streaming perception systems should holistically maximize the overall system performance (i.e., considering both accuracy and latency simultaneously). To this end, we describe a new approach based on deep reinforcement learning to learn these tradeoffs at runtime for streaming perception. This tradeoff optimization is formulated as a novel deep contextual bandit problem and we design a new reward function that holistically integrates latency and accuracy into a single metric. We show that our agent can learn a competitive policy across multiple decision dimensions, which outperforms state-of-the-art policies on public datasets.
研究动机与目标
- 解决现有流媒体感知系统中仅关注延迟或准确率等单一指标而导致的次优决策问题。
- 通过实时联合最大化准确率与最小化延迟,实现系统性能的整体优化。
- 将流媒体感知中的动态权衡建模为具有统一奖励函数的上下文Bandit问题。
- 开发一种可学习的策略,使其能够在运行时适应不同的输入数据与系统约束。
- 在公开数据集上评估该方法,并证明其在性能上优于最先进方法。
提出的方法
- 该方法将流媒体感知决策问题建模为深度上下文Bandit问题,其中动作涉及选择处理配置。
- 设计了一种新颖的奖励函数,将延迟与准确率整合为单一指标,实现联合优化。
- 训练一个深度Q网络(DQN)智能体,基于实时上下文选择动作(如模型分辨率、帧率)以最大化累积奖励。
- 智能体观察输入帧与系统状态,进而选择在性能与效率之间实现平衡的处理策略。
- 通过持续学习准确率与延迟结果的反馈,实现实时在线自适应。
- 该框架支持多维决策,如模型选择、分辨率与帧采样率。
实验结果
研究问题
- RQ1强化学习智能体是否能比单目标方法更有效地在流媒体感知中平衡准确率与延迟?
- RQ2所提出的具有统一奖励函数的上下文Bandit建模方法,在多样化输入数据与系统约束下是否具有良好的泛化能力?
- RQ3所学习的策略在公开基准测试中,与现有启发式或单目标优化策略相比,其性能优越程度如何?
- RQ4当输入流特征发生动态变化时,智能体的决策能力有多强鲁棒性?
- RQ5统一奖励函数对策略收敛性与长期系统性能有何影响?
主要发现
- 所提方法通过联合优化准确率与延迟,实现了卓越的系统性能,在公开数据集上优于最先进策略。
- 深度强化学习智能体学习到一种具有竞争力的策略,能有效适应包括模型选择与帧率在内的多个决策维度。
- 统一奖励函数成功平衡了相互竞争的目标,显著提升了系统整体效率。
- 智能体在不同输入流与运行时条件下展现出强大的泛化能力与适应能力。
- 与以往仅单独优化单一指标(如延迟或准确率)的方法相比,本方法实现了更优的权衡。
- 结果证实,通过深度强化学习实现的整体优化可显著提升端到端系统性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。