Skip to main content
QUICK REVIEW

[论文解读] You Can't Count on Luck: Why Decision Transformers and RvS Fail in Stochastic Environments

Keiran Paster, Sheila A. McIlraith|arXiv (Cornell University)|May 31, 2022
Reinforcement Learning in Robotics被引用 8
一句话总结

该论文识别出决策变压器(Decision Transformers)和RvS(基于监督学习的强化学习)在随机环境中的关键失效模式,即高回报是由于运气而非最优行为所致。作者提出ESPES,通过条件化于与环境随机性无关的表征——特别是聚类平均回报——并利用对抗学习提升目标回报与实际回报之间的对齐,从而在随机离线强化学习基准上实现最先进性能。

ABSTRACT

Recently, methods such as Decision Transformer that reduce reinforcement learning to a prediction task and solve it via supervised learning (RvS) have become popular due to their simplicity, robustness to hyperparameters, and strong overall performance on offline RL tasks. However, simply conditioning a probabilistic model on a desired return and taking the predicted action can fail dramatically in stochastic environments since trajectories that result in a return may have only achieved that return due to luck. In this work, we describe the limitations of RvS approaches in stochastic environments and propose a solution. Rather than simply conditioning on the return of a single trajectory as is standard practice, our proposed method, ESPER, learns to cluster trajectories and conditions on average cluster returns, which are independent from environment stochasticity. Doing so allows ESPER to achieve strong alignment between target return and expected performance in real environments. We demonstrate this in several challenging stochastic offline-RL tasks including the challenging puzzle game 2048, and Connect Four playing against a stochastic opponent. In all tested domains, ESPER achieves significantly better alignment between the target return and achieved return than simply conditioning on returns. ESPER also achieves higher maximum performance than even the value-based baselines.

研究动机与目标

  • 识别为何RvS类智能体(如决策变压器)在确定性环境中表现良好,却在随机环境中失效的原因。
  • 解决核心问题:在随机动力学下,基于轨迹回报的条件化会将最优行为与运气混淆。
  • 开发一种基于与环境随机性无关的回报估计进行条件化的机制,以确保可靠策略学习。
  • 在新型、具有挑战性的随机离线强化学习基准上验证该方法的有效性,其中标准RvS方法已失效。
  • 证明ESPES在随机设置下优于RvS智能体以及强值基基线方法(如CQL)

提出的方法

  • ESPES通过对抗训练学习轨迹表征,以解耦动作相关统计量与环境引起的随机性。
  • 基于动作序列对轨迹进行聚类,并计算每个聚类的平均回报,以此作为条件信号,而非单个轨迹的回报。
  • 采用对抗损失确保学习到的轨迹表征对环境随机性保持不变。
  • 模型被训练为基于状态和聚类平均回报来预测动作,从而在随机环境中实现稳健决策。
  • 该方法端到端可微且可扩展,利用深度学习架构,无需显式因果推断。
  • 使用动力学模型支持对抗聚类,确保表征反映由智能体控制的行为模式。

实验结果

研究问题

  • RQ1为何决策变压器和RvS智能体在确定性基准上表现优异,却在随机环境中失效?
  • RQ2我们能否识别出一种与环境随机性无关的RvS条件信号,从而提升策略学习的可靠性?
  • RQ3基于动作序列估计的聚类平均回报是否能改善随机环境中目标期望回报与实际期望回报之间的对齐?
  • RQ4基于与随机性无关的表征进行条件化的模型,是否能在具有挑战性的随机离线强化学习任务中超越标准RvS和值基方法?
  • RQ5所提出的方法在多样化随机环境(包括部分可观察和高方差领域)中是否具备鲁棒性?

主要发现

  • 在随机环境中,ESPES相较于基于回报条件化的RvS智能体,实现了显著更优的目标回报与预期性能对齐。
  • 在2048益智游戏和对随机对手的连珠棋(Connect Four)中,ESPES达到接近最大性能,甚至优于强值基基线方法(如CQL)。
  • 在赌博环境中,RvS智能体因运气而灾难性地偏好次优动作,而ESPES正确识别出能保证正回报的最优动作(a2)。
  • ESPES中的对抗聚类成功学习到对环境随机性不变的表征,从而实现可靠策略泛化。
  • 即使在无限数据条件下,基于回报条件化的RvS模型在随机设置中仍会失效,证明仅靠数据规模无法解决根本性问题。
  • ESPES表明,基于与环境随机性无关的结果(如每动作聚类的平均回报)进行条件化,可在真实随机任务中实现稳健且最优的决策。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。