Skip to main content
QUICK REVIEW

[论文解读] Target Tracking for Contextual Bandits: Application to Demand Side Management

Margaux Brégère, Pierre Gaillard|arXiv (Cornell University)|Jan 28, 2019
Advanced Bandit Algorithms Research被引用 4
一句话总结

本文提出了一种上下文多臂赌博机框架,用于需求侧管理,通过动态调整电价以跟踪目标平均用电量,利用线性模型和广义加法模型基于温度等上下文因素预测用电量。该方法实现了 T^{2/3} 的遗憾边界(对数项以内),在英国电力网络数据的真实仿真中表现出有效的用电量跟踪能力。

ABSTRACT

We propose a contextual-bandit approach for demand side management by offering price incentives. More precisely, a target mean consumption is set at each round and the mean consumption is modeled as a complex function of the distribution of prices sent and of some contextual variables such as the temperature, weather, and so on. The performance of our strategies is measured in quadratic losses through a regret criterion. We offer $T^{2/3}$ upper bounds on this regret (up to poly-logarithmic terms)---and even faster rates under stronger assumptions---for strategies inspired by standard strategies for contextual bandits (like LinUCB, see Li et al., 2010). Simulations on a real data set gathered by UK Power Networks, in which price incentives were offered, show that our strategies are effective and may indeed manage demand response by suitably picking the price levels.

研究动机与目标

  • 开发一种动态定价策略,利用上下文多臂赌博机算法跟踪随时间变化的目标平均用电量。
  • 将用电量建模为价格水平和温度、天气等上下文变量的函数。
  • 通过最小化遗憾来最小化跟踪目标用电量的二次损失。
  • 在英国电力网络的真实数据上评估该方法,以证明其实际有效性。

提出的方法

  • 使用线性或广义加法模型,将平均用电量建模为价格费率和上下文变量的函数。
  • 采用上下文多臂赌博机算法,其中提供方可根据上下文选择价格分配以最小化跟踪误差。
  • 该算法采用受 LinUCB 启发的置信区间方法,遗憾分析基于特征协方差矩阵的逆矩阵。
  • 损失函数定义为观测到的平均用电量与目标之间的平方偏差,遗憾通过集中不等式进行边界控制。
  • 该方法引入了噪声模型,其协方差矩阵通过历史残差的经验协方差矩阵估计。
  • 利用矩阵集中不等式和对数迹不等式推导理论边界,以控制不确定性的增长。

实验结果

研究问题

  • RQ1通过调整价格激励,上下文多臂赌博机算法能否有效跟踪电力需求中的移动目标?
  • RQ2在需求侧管理的目标跟踪场景中,该方法可实现怎样的遗憾边界?
  • RQ3所提出算法在真实世界数据上的性能与基线策略相比如何?
  • RQ4温度和一天中的时间段等上下文变量对用电量预测精度有何影响?
  • RQ5在何种条件下可实现快于 T^{2/3} 的收敛速率?

主要发现

  • 在一般假设下,所提算法以高概率实现 T^{2/3} 的遗憾边界,对数项以内。
  • 在更强假设下,如噪声有界且特征矩阵条件良好,可实现更快的收敛速率。
  • 在真实英国电力网络数据上的仿真表明,该方法通过价格激励有效跟踪了目标用电量水平。
  • 残差的经验协方差矩阵显著非对角,表明不同价格费率间的噪声存在相关性,该模型已对此进行建模。
  • 与静态定价策略相比,该方法通过动态适应变化的上下文和用电目标,表现出更优性能。
  • 理论分析证实,该算法通过模型参数的置信区间平衡了探索与利用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。