Skip to main content
QUICK REVIEW

[论文解读] Adversarially Trained Actor Critic for Offline Reinforcement Learning

Ching-An Cheng, Tengyang Xie|arXiv (Cornell University)|Feb 5, 2022
Adversarial Robustness in Machine Learning被引用 7
一句话总结

ATAC 是一种新型的无模型离线强化学习算法,将离线强化学习建模为策略演员与对抗训练的价值评论家之间的双人Stackelberg博弈。通过利用相对悲观主义和无遗憾优化,ATAC 在广泛超参数范围内可证明地优于行为策略,并在数据覆盖最优策略时实现最优性能,在 D4RL 基准测试中超越了当前最先进方法。

ABSTRACT

We propose Adversarially Trained Actor Critic (ATAC), a new model-free algorithm for offline reinforcement learning (RL) under insufficient data coverage, based on the concept of relative pessimism. ATAC is designed as a two-player Stackelberg game: A policy actor competes against an adversarially trained value critic, who finds data-consistent scenarios where the actor is inferior to the data-collection behavior policy. We prove that, when the actor attains no regret in the two-player game, running ATAC produces a policy that provably 1) outperforms the behavior policy over a wide range of hyperparameters that control the degree of pessimism, and 2) competes with the best policy covered by data with appropriately chosen hyperparameters. Compared with existing works, notably our framework offers both theoretical guarantees for general function approximation and a deep RL implementation scalable to complex environments and large datasets. In the D4RL benchmark, ATAC consistently outperforms state-of-the-art offline RL algorithms on a range of continuous control tasks.

研究动机与目标

  • 解决在数据覆盖有限的情况下,离线强化学习中安全且一致的策略改进挑战。
  • 开发一种方法,可在广泛超参数范围内可证明地优于行为策略,确保在风险敏感应用中的鲁棒性。
  • 在保持对复杂环境和大规模数据集可扩展性的同时,为一般函数逼近提供理论保证。
  • 克服现有方法需要精细超参数调优或过度保守的局限性。

提出的方法

  • ATAC 将离线强化学习建模为一个Stackelberg博弈,其中演员作为领导者,评论家作为跟随者,通过对抗方式识别出演员表现劣于行为策略的数据一致场景。
  • 评论家被训练以找到贝尔曼一致的状态,即在这些状态下演员的表现劣于行为策略,从而强制实施相对悲观主义。
  • 演员通过基于历史评论家的无遗憾优化过程进行更新,确保收敛到优于行为策略的策略。
  • 该算法采用随机一阶、双时间尺度优化,实现大规模数据集下可扩展的深度强化学习训练。
  • 采用最大最小公式,与 CQL 的最小最大方法形成对比,以确保在悲观主义水平较低时仍能实现稳健的策略改进。
  • 该方法引入函数逼近假设,以确保在非线性设置下的理论一致性与泛化能力。

实验结果

研究问题

  • RQ1我们能否设计一种离线强化学习算法,在无需精确调优的情况下,可在广泛超参数范围内可证明地优于行为策略?
  • RQ2当数据覆盖最优策略访问的状态时,如何在一般函数逼近下实现学习一致性和最优性能?
  • RQ3博弈论结构——特别是最大最小与最小最大——对离线强化学习中稳健策略改进的影响是什么?
  • RQ4评论家的对抗训练是否能带来更强的理论保证,同时保持对深度神经网络和大规模数据集的可扩展性?

主要发现

  • ATAC 在控制悲观主义的广泛超参数值范围内可证明地优于行为策略,包括在 β=0 时,该值可作为安全锚定点。
  • 当离线数据覆盖最优策略访问的状态时,ATAC 实现了最优性能,表现出学习一致性。
  • 在 D4RL 基准测试中,ATAC 在连续控制任务中持续优于当前最先进离线强化学习算法,包括在具有挑战性的 hopper-medium-expert 环境中。
  • 与 CQL 不同,CQL 在 β=0 时由于其最小最大公式无法保证安全的策略改进,而 ATAC 在所有 β 值下均保持鲁棒性,包括在最保守的极端情况下。
  • 理论分析表明,在标准函数逼近假设下,Stackelberg 博弈中的无遗憾学习可导致可证明改进的策略。
  • 实验结果表明,ATAC 在多个随机种子下性能稳定且更优,在所有评估环境中均一致地优于基线方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。