[论文解读] Unbiased Asymmetric Reinforcement Learning under Partial Observability
该论文提出了一种无偏的非对称演员-评论家方法,用于部分可观察强化学习,采用历史状态值函数 $\hat{V}(h,s)$ 代替仅基于状态的评论家,解决了先前有偏方法中的理论缺陷。该方法确保了策略梯度的有效性,降低了训练偏差,并在内存密集型、部分可观察环境(如 Heaven-Hell-4 和 Memory-Four-Rooms-9x9)中实现了比对称及有偏非对称基线更快的收敛速度和更优的性能。
In partially observable reinforcement learning, offline training gives access to latent information which is not available during online training and/or execution, such as the system state. Asymmetric actor-critic methods exploit such information by training a history-based policy via a state-based critic. However, many asymmetric methods lack theoretical foundation, and are only evaluated on limited domains. We examine the theory of asymmetric actor-critic methods which use state-based critics, and expose fundamental issues which undermine the validity of a common variant, and limit its ability to address partial observability. We propose an unbiased asymmetric actor-critic variant which is able to exploit state information while remaining theoretically sound, maintaining the validity of the policy gradient theorem, and introducing no bias and relatively low variance into the training process. An empirical evaluation performed on domains which exhibit significant partial observability confirms our analysis, demonstrating that unbiased asymmetric actor-critic converges to better policies and/or faster than symmetric and biased asymmetric baselines.
研究动机与目标
- 识别现有非对称演员-评论家方法在部分可观察环境中使用基于状态的评论家 $V^\pi(s)$ 时存在的理论缺陷。
- 在部分可观察性条件下,为非对称演员-评论家方法建立严格的策略梯度定理,明确纳入潜在状态信息。
- 设计一种新颖的无偏非对称演员-评论家变体,利用历史-状态对 $(h,s)$ 作为评论家的输入,确保不引入学习偏差。
- 在高部分可观察性的环境中实证验证理论主张,证明其在收敛速度和最终策略质量上优于对称和有偏非对称基线。
- 为单智能体和多智能体强化学习中的离线训练中特权信息的合理使用奠定基础。
提出的方法
- 提出一种新型评论家架构 $\hat{V}^\pi(h,s)$,联合依赖于智能体的历史 $h$ 和真实系统状态 $s$,从而在 POMDP 中实现更精确的值估计。
- 推导出一种新的非对称策略梯度定理,正式证明 $\hat{V}^\pi(h,s)$ 在策略优化中使用的合理性,确保无偏梯度更新。
- 提出 A2C-asym-hs 算法,作为优势演员-评论家(A2C)的扩展,使用历史-状态评论家,同时保持与标准 A2C 相同的策略网络。
- 采用一种训练目标,确保评论家的值估计同时基于可观测历史和特权状态,避免仅基于状态的评论家带来的模糊性。
- 采用双分支网络结构,评论家接收历史和状态输入,而策略仍基于历史信息,从而在在线执行中保持约束。
- 使用离策略经验回放和标准 A2C 更新规则,但将值函数目标修改为使用历史-状态评论家,确保学习的一致性与无偏性。

实验结果
研究问题
- RQ1为何在部分可观察环境中,非对称演员-评论家方法中基于状态的评论家 $V^\pi(s)$ 会导致学习偏差?
- RQ2能否为包含特权状态信息的非对称演员-评论家方法推导出一个理论严谨的策略梯度定理?
- RQ3使用历史-状态评论家 $\hat{V}^\pi(h,s)$ 而非仅基于状态的评论家 $\hat{V}^\pi(s)$ 是否能消除 POMDP 中的学习偏差并提升策略性能?
- RQ4所提出的无偏非对称方法在收敛速度和最终策略质量方面,相较于对称 A2C 和有偏非对称基线表现如何?
- RQ5该方法是否可推广至 A2C 之外的其他基于评论家的深度强化学习算法?
主要发现
- 在 POMDP 中,基于状态的评论家 $\hat{V}^\pi(s)$ 本质上是定义不清的,因为多个不同的历史可能映射到同一状态,导致值估计模糊和学习偏差。
- A2C-asym-hs 评论家通过同时依赖历史 $h$ 和状态 $s$,即使在状态相同的情况下,也能为不同历史产生不同的值输出,从而实现正确的信用分配。
- 在 Heaven-Hell-4 环境中,A2C-asym-hs 评论家正确地为智能体曾访问过神父的状态分配更高的值,表明其识别出信息收集行为的重要性。
- 实验结果表明,无偏的 A2C-asym-hs 方法在 Memory-Four-Rooms-9x9 和 Heaven-Hell-4 环境中均比对称 A2C 和有偏非对称基线收敛更快,且最终回报更高。
- A2C-asym-hs 方法在不同运行中保持一致的值估计,而有偏的 A2C-asym-s 评论家对具有相同状态但不同历史的情况产生相同的值,从而破坏学习过程。
- 该方法是首个提供理论基础、无偏的非对称演员-评论家框架,确保在部分可观察性条件下策略梯度定理的有效性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。