Skip to main content
QUICK REVIEW

[论文解读] Decoupling Value and Policy for Generalization in Reinforcement Learning

Roberta Răileanu, Rob Fergus|arXiv (Cornell University)|Feb 20, 2021
Reinforcement Learning in Robotics参考文献 52被引用 4
一句话总结

该论文提出 IDAAC,一种新颖的强化学习方法,通过使用独立网络解耦策略与价值函数学习,并强制对任务无关视觉特征的表示不变性,来解决策略-价值表示不对称性问题。该方法在仅使用有限训练关卡的情况下,在 Procgen 和 DeepMind Control 基准测试中实现了最先进(SOTA)的泛化性能,尤其在低样本场景下表现优异。

ABSTRACT

Standard deep reinforcement learning algorithms use a shared representation for the policy and value function, especially when training directly from images. However, we argue that more information is needed to accurately estimate the value function than to learn the optimal policy. Consequently, the use of a shared representation for the policy and value function can lead to overfitting. To alleviate this problem, we propose two approaches which are combined to create IDAAC: Invariant Decoupled Advantage Actor-Critic. First, IDAAC decouples the optimization of the policy and value function, using separate networks to model them. Second, it introduces an auxiliary loss which encourages the representation to be invariant to task-irrelevant properties of the environment. IDAAC shows good generalization to unseen environments, achieving a new state-of-the-art on the Procgen benchmark and outperforming popular methods on DeepMind Control tasks with distractors. Our implementation is available at https://github.com/rraileanu/idaac.

研究动机与目标

  • 解决在程序化生成环境的有限实例上训练时,深度强化学习中泛化能力差的问题。
  • 识别并解决策略-价值表示不对称性问题,即价值估计需要实例特定的细节,而最优策略学习并不需要这些信息。
  • 通过解耦策略与价值函数优化并强制对无关视觉变化的不变性,来提升泛化能力。
  • 在仅使用少量训练数据的情况下,实现在 Procgen 和 DeepMind Control 基准测试中的最先进性能。

提出的方法

  • IDAAC 通过为策略和价值函数分别使用独立的神经网络,实现策略与价值函数的解耦,避免共享表示中可能引入的虚假相关性。
  • 引入辅助损失,促使共享表示对任务无关的视觉变化(如背景颜色或图案)保持不变。
  • 采用对比学习方法,在视觉扰动(如背景替换)下最小化表示变化,同时保留与任务相关的状态信息。
  • 策略与价值网络使用标准的优势行动者-评论家目标联合训练,但采用解耦的反向传播以减少干扰。
  • 在包含干扰物的 Procgen 和 DeepMind Control 环境中评估该方法,使用特征范数、价值/优势差异以及背景变化下的策略差异等指标。
  • 模型仅在 200 个关卡上进行训练,适用于低数据泛化场景。

实验结果

研究问题

  • RQ1在程序化生成环境中,策略与价值函数共享单一表示是否会导致过拟合?
  • RQ2解耦策略与价值学习是否能提升对未见关卡的泛化能力?
  • RQ3对无关视觉特征(如背景)强制不变性是否能提升鲁棒性与泛化能力?
  • RQ4在低数据和干扰物丰富的设置下,IDAAC 与 SOTA 方法(如 PPO 和 PPG)相比表现如何?
  • RQ5通过辅助对比损失能否有效学习表示不变性,同时不损害策略性能?

主要发现

  • IDAAC 在 Procgen 基准测试中实现了最先进性能,尽管仅在 200 个关卡上进行训练,仍优于先前方法。
  • 该方法对背景变化表现出显著提升的鲁棒性:表示范数和价值/优势差异均低于 PPO 与 PPG,表明对无关视觉特征的敏感度降低。
  • IDAAC 学习到的表示对背景变化具有不变性,表现为同一观测在 10 种不同背景变体下的 L1 和 L2 范数差异极低。
  • 策略鲁棒性通过 Jensen-Shannon 散度衡量,结果与基线方法相当或更优,尽管在某些环境中因动作等价性导致 JSD 并非完美指标。
  • 即使 PPO-10k(在 10,000 个关卡上训练)表现出更好的鲁棒性指标,IDAAC 仍展现出更优的泛化能力,证明其在远少数据下实现高性能泛化的潜力。
  • 辅助不变性损失有效减少了价值估计中对关卡特定特征的记忆化,且未损害策略性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。