[论文解读] Regret Balancing for Bandit and RL Model Selection
本文提出了一种用于随机多臂赌博机和强化学习中模型选择的遗憾平衡策略,其中智能体通过选择经验遗憾最小的基算法来在所有选项间实现性能平衡。该方法在无需稳定性条件的情况下实现了近似最优遗憾,并表明了解最优基算法遗憾是实现近似最优性的必要条件。
We consider model selection in stochastic bandit and reinforcement learning problems. Given a set of base learning algorithms, an effective model selection strategy adapts to the best learning algorithm in an online fashion. We show that by estimating the regret of each algorithm and playing the algorithms such that all empirical regrets are ensured to be of the same order, the overall regret balancing strategy achieves a regret that is close to the regret of the optimal base algorithm. Our strategy requires an upper bound on the optimal base regret as input, and the performance of the strategy depends on the tightness of the upper bound. We show that having this prior knowledge is necessary in order to achieve a near-optimal regret. Further, we show that any near-optimal model selection strategy implicitly performs a form of regret balancing.
研究动机与目标
- 解决在随机多臂赌博机和强化学习设置中,当最优基算法事先未知时,从多个基学习算法中进行选择的挑战。
- 开发一种在线自适应策略,以选择表现最佳的基算法,且无需对基算法进行任何修改。
- 证明遗憾平衡在模型选择中既是必要条件也是充分条件,即使基算法不稳定,也能实现近似最优遗憾。
- 建立理论上的必要性:为实现近似最优性能,必须知道最优基算法遗憾,或能直接访问动作反馈。
- 将模型选择框架扩展至线性MDP,并证明遗憾平衡在该设置下可实现紧致的遗憾界。
提出的方法
- 实时估计每个基算法的经验遗憾,并在每一步选择经验遗憾最小的算法。
- 使用目标遗憾函数 $ U(t) $ 引导平衡过程,确保所有基算法的遗憾以相似速率增长。
- 将遗憾平衡策略应用于随机多臂赌博机和线性MDP,其中在强化学习设置中使用LSVI-UCB作为基算法。
- 引入强制探索机制,以在未知最优基算法遗憾时实现近似最优性能。
- 通过理论分析表明,任何实现近似最优性的模型选择策略,其隐含行为必然是遗憾平衡。
- 证明:若缺乏对最优基算法遗憾的先验知识或无法直接采样动作,则任何模型选择策略均无法实现近似最优性。
实验结果
研究问题
- RQ1是否存在一种模型选择策略,可在不依赖基算法稳定性条件的前提下,实现随机多臂赌博机和强化学习问题中的近似最优遗憾?
- RQ2即使基算法不稳定,遗憾平衡是否仍是实现近似最优遗憾的必要条件?
- RQ3对最优基算法遗憾的先验知识在实现近似最优性能的模型选择中起什么作用?
- RQ4遗憾平衡能否扩展至线性MDP?在该类设置下可实现何种遗憾界?
- RQ5是否存在某些问题实例,使得任何近似最优的模型选择策略都必须隐式执行遗憾平衡?
主要发现
- 当使用 $ M $ 个特征映射的LSVI-UCB时,该策略在线性MDP中实现了 $ \tilde{\mathcal{O}}(M\sqrt{d^{3}H^{3}T}) $ 的遗憾界。
- 该策略无需对基算法进行任何修改,因此可适用于任何随机多臂赌博机算法,包括UCB和Thompson采样。
- 任何实现近似最优性的模型选择策略,其隐含行为必然是遗憾平衡,这一点通过下界构造得到证明。
- 了解最优基算法遗憾是实现近似最优性的必要条件;否则,遗憾将严格劣于最优基算法的遗憾。
- 通过强制探索机制,该遗憾平衡策略即使在最优基算法遗憾未知时,也能实现近似最优性。
- 理论分析表明,遗憾平衡在一大类问题中,对于实现近似最优模型选择而言,既是充分条件也是必要条件。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。