[论文解读] Active Reinforcement Learning: Observing Rewards at a Cost
本文提出主动强化学习(ARL),其中智能体需支付费用才能观测奖励,提出启发式算法以在查询成本与长期奖励收益之间取得平衡。结果表明,在复杂环境中,信息价值(VOI)与带查询遗憾的自适应采样(ASQR)方法通过智能选择需查询的状态-动作对,显著优于基线方法,尤其在奖励观测成本较高时表现更优。
Active reinforcement learning (ARL) is a variant on reinforcement learning where the agent does not observe the reward unless it chooses to pay a query cost c > 0. The central question of ARL is how to quantify the long-term value of reward information. Even in multi-armed bandits, computing the value of this information is intractable and we have to rely on heuristics. We propose and evaluate several heuristic approaches for ARL in multi-armed bandits and (tabular) Markov decision processes, and discuss and illustrate some challenging aspects of the ARL problem.
研究动机与目标
- 解决在人类提供的奖励昂贵或耗时的复杂任务中设计奖励函数的挑战。
- 建模观测奖励需支付固定成本的强化学习问题,要求智能体战略性地决定何时查询。
- 探索在多臂赌博机与表格型马尔可夫决策过程(MDPs)中,平衡即时查询成本与长期信息价值的启发式策略。
- 评估不同查询策略在不同查询成本下对学习效率与累积回报的影响。
- 研究在存在不可避免或低信息量状态的环境中,查询频率、时机与策略性能之间的权衡。
提出的方法
- 智能体选择动作,并决定是否支付固定成本 c > 0 以在下一时间步观测奖励。
- 提出启发式算法,包括信息价值(VOI)与带查询遗憾的自适应采样(ASQR),以估计查询某一状态-动作的长期收益。
- 使用奖励上的正态先验进行贝叶斯推断,并在每次查询后更新后验均值,以估计未来期望价值。
- 在基于模型的 ARL 中,通过蒙特卡洛轨迹采样估计期望回报,并指导查询决策。
- 在 VOI 算法中使用 k=1 以近似查询某一状态-动作所获得的期望信息增益。
- 利用已知的环境动态模型模拟未来轨迹,估计查询对策略改进的影响。
实验结果
研究问题
- RQ1当观测奖励需支付成本时,智能体如何量化奖励信息的长期价值?
- RQ2哪些启发式策略能有效促进 ARL 中的探索与查询,特别是在存在不可避免或无信息量状态的环境中?
- RQ3不同查询成本水平(低 vs. 高)如何影响 ARL 智能体的性能与查询行为?
- RQ4在如“长 Y”MDP 等复杂环境中,基于 VOI 的策略是否能优于均匀或固定频率的查询策略?
- RQ5智能体对奖励的先验信念如何影响其查询策略与整体学习性能?
主要发现
- 在‘长 Y’环境中,基于 VOI 的算法通过避免在不可避免的低信息量状态中查询,表现优于其他方法。
- 在链式环境中,基于 ASQR 的算法获得的回报高于 VOI,表明其对序列性、高不确定性任务具有更好的适应性。
- 将所有状态-动作查询最多 25 次的基线策略整体表现较差,尤其在高查询成本下,因过度查询导致性能下降。
- 在高查询成本(c=10)下,完全不查询在链式环境中表现出人意料的优异性能,归因于智能体的乐观先验与任务难度。
- VOI 算法在早期回合中查询频率较低,此为次优表现;这表明需通过置信区间或更多环境采样来增强早期查询激励。
- 实证结果表明,即使实验有限,在线自适应查询策略也显著优于固定或均匀查询策略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。