Skip to main content
QUICK REVIEW

[论文解读] Making Sense of Reinforcement Learning and Probabilistic Inference

Brendan O’Donoghue, Ian Osband|arXiv (Cornell University)|Jan 3, 2020
Reinforcement Learning in Robotics参考文献 46被引用 12
一句话总结

本文指出了流行‘强化学习即推理’框架中的一个关键缺陷:它忽略了认知不确定性,导致即使在简单问题中也出现探索性能差的问题。作者提出了一种改进的推理框架——等价于K-learning——能正确处理不确定性,实现可证明高效的探索,并在表格型和深度强化学习设置中优于标准方法(如软Q-learning)。

ABSTRACT

Reinforcement learning (RL) combines a control problem with statistical estimation: The system dynamics are not known to the agent, but can be learned through experience. A recent line of research casts `RL as inference' and suggests a particular framework to generalize the RL problem as probabilistic inference. Our paper surfaces a key shortcoming in that approach, and clarifies the sense in which RL can be coherently cast as an inference problem. In particular, an RL agent must consider the effects of its actions upon future rewards and observations: The exploration-exploitation tradeoff. In all but the most simple settings, the resulting inference is computationally intractable so that practical RL algorithms must resort to approximation. We demonstrate that the popular `RL as inference' approximation can perform poorly in even very basic problems. However, we show that with a small modification the framework does yield algorithms that can provably perform well, and we show that the resulting algorithm is equivalent to the recently proposed K-learning, which we further connect with Thompson sampling.

研究动机与目标

  • 识别‘强化学习即推理’框架中的根本性缺陷,该缺陷导致在简单决策问题中探索性能差。
  • 阐明将强化学习正确表述为概率推理的方式,包括对未来的动作和观测进行推理。
  • 表明原始的贝叶斯最优解已同时包含控制与推理,但其计算上不可行。
  • 提出对‘强化学习即推理’框架的合理修正,以纳入认知不确定性,从而实现更优的探索。
  • 通过实证结果证明,修正后的框架(K-learning)能随问题规模良好扩展,而软Q-learning则不能。

提出的方法

  • 将强化学习问题重新表述为对未来的动作和观测的贝叶斯推理问题,模型中包含认知不确定性。
  • 使用概率图模型(PGM)表示带有指数奖励的MDP,将策略视为隐变量。
  • 引入一种修正的推理目标,以考虑信息的价值,确保探索由不确定性驱动。
  • 推导出K-learning作为该修正推理框架的合理近似,采用Q值后验采样的方法。
  • 在深度强化学习中,通过集成方法和随机化先验函数来近似后验分布。
  • 在表格型和深度强化学习基准上评估性能,特别以DeepSea MDP为测试环境,使用遗憾度量和学习时间作为评估指标。

实验结果

研究问题

  • RQ1为何标准的‘强化学习即推理’框架在简单决策问题中失败,尽管其理论吸引力强?
  • RQ2如何正确形式化强化学习与概率推理之间的联系,以包含认知不确定性?
  • RQ3对‘强化学习即推理’框架进行何种修改可实现可证明高效的探索?
  • RQ4与Thompson采样和软Q-learning相比,该算法在样本效率方面表现如何?
  • RQ5从修正后的推理框架中获得的洞见能否在函数逼近的深度强化学习中实现可扩展性?

主要发现

  • 标准的‘强化学习即推理’框架在简单问题中失败,是因为忽略了认知不确定性,导致探索性能差,且遗憾度量随问题规模呈指数增长。
  • 软Q-learning(源自该有缺陷的框架)无法随问题规模良好扩展,在DeepSea MDP中学习最优策略需指数时间。
  • K-learning是修正后的推理框架的改进版本,能有效处理不确定性,其性能随问题规模呈多项式增长,实现接近最优的学习时间。
  • Thompson采样和K-learning在表格型和深度强化学习设置中均表现出良好的可扩展性,而软Q-learning在探索密集型任务中表现失败。
  • 使用神经网络集成和随机化先验的K-learning深度强化学习实现,在输入为独热像素的DeepSea环境中成功实现了深度探索。
  • 结果证实,在推理框架中纳入认知不确定性对高效探索至关重要,而K-learning为此挑战提供了一个合理的解决方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。