Skip to main content
QUICK REVIEW

[论文解读] Hindsight Expectation Maximization for Goal-conditioned Reinforcement Learning

Yunhao Tang, Alp Kucukelbir|arXiv (Cornell University)|Jun 13, 2020
Reinforcement Learning in Robotics参考文献 57被引用 7
一句话总结

本文提出Hindsight Expectation Maximization(hEM),一种概率性强化学习框架,将目标条件强化学习建模为变分推断问题,通过监督学习更新实现稳定的策略优化。通过将事后经验回放解释为重要性采样,hEM显著优于基线方法——尤其在高维图像输入下表现更优,展示了在稀疏奖励环境中的优越样本效率与稳定性。

ABSTRACT

We propose a graphical model framework for goal-conditioned RL, with an EM algorithm that operates on the lower bound of the RL objective. The E-step provides a natural interpretation of how 'learning in hindsight' techniques, such as HER, to handle extremely sparse goal-conditioned rewards. The M-step reduces policy optimization to supervised learning updates, which greatly stabilizes end-to-end training on high-dimensional inputs such as images. We show that the combined algorithm, hEM significantly outperforms model-free baselines on a wide range of goal-conditioned benchmarks with sparse rewards.

研究动机与目标

  • 解决在稀疏二元奖励环境中训练目标条件强化学习智能体的挑战,传统方法因缺乏信用分配而失效。
  • 通过将策略优化重新表述为监督学习,克服高维输入(如图像)下时序差分学习的不稳定性。
  • 在概率图模型框架内,将事后经验回放形式化为重要性采样的特例。
  • 开发一种稳定、端到端的训练流程,适用于目标条件强化学习,可泛化至多样化任务与输入模态,包括基于图像的观测。

提出的方法

  • 将目标条件强化学习目标表述为最大化概率模型的证据,从而导出可优化的下界(ELBO)。
  • 设计一种EM算法,其中E步通过事后目标重加权轨迹,将失败轨迹有效视为其他目标的成功轨迹——等价于罕见事件的重要性采样。
  • M步通过在重加权轨迹上进行监督学习更新执行策略优化,从而在高维输入(如图像)上实现训练稳定。
  • 提出一种混合算法,结合hEM与HER,使用加权损失融合基于TD的Q-learning与hEM的监督策略更新,以提升样本效率。
  • 引入变分后验 $ q_{\phi}(z \mid x) $ 近似真实后验,实现证据下界(ELBO)的可微分优化。
  • 使用策略收集轨迹,随后应用事后重标注生成多样化的目标条件经验,用于M步中通过监督学习训练策略。

实验结果

研究问题

  • RQ1能否从概率推断的角度,正式解释事后经验回放为重要性采样?
  • RQ2在稀疏奖励的目标条件强化学习中,如何提升高维观测空间(如图像)下策略优化的稳定性?
  • RQ3将目标条件强化学习形式化为变分推断问题,是否能带来比标准off-policy强化学习方法更优的样本效率与收敛性?
  • RQ4EM框架能否扩展以结合HER与监督学习的优势,从而在复杂机器人任务中实现更优性能?

主要发现

  • hEM在所有基准任务中均持续优于HER,尤其在基于图像输入的任务中优势显著,因为HER的TD-based更新在高维观测下性能下降。
  • 在Fetch机器人和Sawyer机器人任务中,使用基于图像的目标时,hEM性能可与基于状态的目标表示相媲美,表明对输入模态具有鲁棒性。
  • 当 $ \eta = 0.1 $ 时,混合hEM-HER算法在学习速度上相比HER本身有微小提升,尤其在目标空间复杂的挑战性Fetch任务中表现更优。
  • 更大的轨迹收集规模 $ N $ 会带来更好的性能,证实了目标空间充分覆盖对稳定学习至关重要。
  • hEM的基于监督学习的M步显著提升了训练稳定性,尤其在端到端训练原始像素时,优于HER的TD学习更新。
  • 该方法在一系列目标条件强化学习基准测试中达到最先进性能,尤其在稀疏奖励设置与高维输入场景下表现卓越。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。