Skip to main content
QUICK REVIEW

[论文解读] Curiosity-Driven Experience Prioritization via Density Estimation

Rui Zhao, Volker Tresp|arXiv (Cornell University)|Feb 20, 2019
Visual Attention and Saliency Detection参考文献 49被引用 42
一句话总结

CDP 通过变分高斯混合模型在回放缓冲区估计轨迹密度,并优先选择低密度(罕见)的已实现目标轨迹,以在与离策略强化学习方法(如 DDPG 和 DDPG+HER)结合时提升样本效率和性能。

ABSTRACT

In Reinforcement Learning (RL), an agent explores the environment and collects trajectories into the memory buffer for later learning. However, the collected trajectories can easily be imbalanced with respect to the achieved goal states. The problem of learning from imbalanced data is a well-known problem in supervised learning, but has not yet been thoroughly researched in RL. To address this problem, we propose a novel Curiosity-Driven Prioritization (CDP) framework to encourage the agent to over-sample those trajectories that have rare achieved goal states. The CDP framework mimics the human learning process and focuses more on relatively uncommon events. We evaluate our methods using the robotic environment provided by OpenAI Gym. The environment contains six robot manipulation tasks. In our experiments, we combined CDP with Deep Deterministic Policy Gradient (DDPG) with or without Hindsight Experience Replay (HER). The experimental results show that CDP improves both performance and sample-efficiency of reinforcement learning agents, compared to state-of-the-art methods.

研究动机与目标

  • 通过优先考虑代表性不足的已实现目标轨迹来激发和解决RL回放缓冲区中的内存不平衡。
  • 开发一个受好奇心启发的优先级框架(CDP),使体验缓冲区的采样保持平衡。
  • 使 CDP 能与离策略 RL 算法(如 DDPG 与 DDPG+HER)结合。
  • 利用密度估计来引导优先回放,而非 TD-errors。
  • 在多任务机器人操作任务中展示样本效率和最终性能的提升。

提出的方法

  • 用跨时间的目标状态串联序列来表示每条轨迹。
  • 用在记忆缓冲区数据上训练的变分高斯混合模型(V-GMM)来估计轨迹密度。
  • 计算轨迹密度 rho 及其互补 bar{rho} = 1 - rho,以识别罕见轨迹。
  • 按 bar{rho} 的排名对轨迹进行排序,并根据基于该排序的概率进行采样以重放较不频繁的轨迹。
  • 将 CDP 与离策略 RL 算法(如 DDPG、DDPG+HER)整合,并在每个训练时期更新密度模型。
  • 可选地将 CDP 与 Prioritized Experience Replay (PER) 进行比较,并展示 CDP 的时间复杂度优势。

实验结果

研究问题

  • RQ1将 CDP 纳入是否能提升 DDPG 和 DDPG+HER 在多目标机器人任务上的性能与样本效率?
  • RQ2在性能提升和计算效率方面,CDP 与 PER 有何对比?
  • RQ3在训练过程中,基于密度的优先级(bar{rho})与 TD-errors 之间的关系是什么?

主要发现

  • CDP 在六个机器人任务上加速收敛,并获得高于基线和 PER 的最终成功率。
  • CDP 在六个环境中的样本效率平均提高约两倍。
  • CDP 在训练时间上显著快于 PER(CDP 介于基线与 PER 之间;PER 速度更慢),同时提供同等或更好的性能。
  • 相对于基线,最终性能的平均提升约为 9.15 个百分点。
  • 互补密度 bar{rho} 与 TD-errors 之间存在正相关(平均 Pearson r ≈ 0.7),表明罕见轨迹往往对学习更有价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。