Skip to main content
QUICK REVIEW

[论文解读] Adaptive Sensor Placement for Continuous Spaces

James A. Grant, Alexis Boukouvalas|arXiv (Cornell University)|May 16, 2019
Advanced Bandit Algorithms Research被引用 8
一句话总结

该论文提出了一种基于Thompson采样的算法,用于在连续区间内自适应地进行传感器部署,利用非参数贝叶斯直方图推断非齐次泊松过程的事件率。该方法实现了$×(T^{2/3})$的贝叶斯后悔边界,优于UCB和$¥$-greedy方法,在模拟实验中表现出更低且更稳定的后悔值。

ABSTRACT

We consider the problem of adaptively placing sensors along an interval to detect stochastically-generated events. We present a new formulation of the problem as a continuum-armed bandit problem with feedback in the form of partial observations of realisations of an inhomogeneous Poisson process. We design a solution method by combining Thompson sampling with nonparametric inference via increasingly granular Bayesian histograms and derive an $ ilde{O}(T^{2/3})$ bound on the Bayesian regret in $T$ rounds. This is coupled with the design of an efficent optimisation approach to select actions in polynomial time. In simulations we demonstrate our approach to have substantially lower and less variable regret than competitor algorithms.

研究动机与目标

  • 将连续区间内的序列传感器部署建模为具有泊松过程反馈的连续动作臂Bandit问题。
  • 解决在具有重尾点过程反馈的连续空间中学习事件率函数的挑战。
  • 设计一种高效的算法,在最小化贝叶斯后悔的同时平衡探索与利用。
  • 为在已知率函数下的传感器部署开发一种可扩展的优化方法。
  • 提供一种与先验分布选择无关的理论后悔边界。

提出的方法

  • 将传感器部署建模为具有来自非齐次泊松过程的部分观测的连续动作臂Bandit问题。
  • 使用粒度逐渐增加的贝叶斯直方图,在连续动作空间上进行非参数推断。
  • 应用Thompson采样,基于各区间速率的后验样本选择动作。
  • 采用渐进式离散化策略,随时间推移细化网格以提高分辨率。
  • 集成一种高效的优化方法,用于计算所采样率函数下的最优传感器部署位置。
  • 利用Russo & Van Roy (2014) 的技术,推导出$\tilde{O}(T^{2/3})$的贝叶斯后悔边界。

实验结果

研究问题

  • RQ1基于非参数贝叶斯直方图的Thompson采样能否在具有泊松反馈的连续传感器部署中有效平衡探索与利用?
  • RQ2该策略的理论后悔性能在$T$上的表现如何?
  • RQ3重采样率的选择如何影响后验推断的准确性和后悔值?
  • RQ4与UCB和$\epsilon$-greedy基线方法相比,该方法在后悔值和方差方面的实验表现如何?
  • RQ5该算法能否在多项式时间内保持计算效率的同时实现低后悔?

主要发现

  • 在所有模拟场景中,Thompson采样方法的后悔值均显著低于UCB、$\epsilon$-greedy以及改进的UCB策略。
  • UCB策略因在低活动区域过度估计速率而导致高后悔值,即使在900次迭代后仍表现不佳。
  • $\epsilon$-greedy方法因探索不足,导致后悔值方差较高,严重依赖随机化以逃离局部最优。
  • 后验方差分析表明,Thompson采样能有效将观测集中于高事件率区域,同时在未探索区域保持不确定性。
  • 立方根重采样率在后验推断准确性和最低后悔值方面表现最佳,优于线性和平方根重采样率。
  • 理论后悔边界$\tilde{O}(T^{2/3})$接近于简单CAB模型的$\Omega(T^{2/3})$下界,表明其具有强大的理论性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。