Skip to main content
QUICK REVIEW

[论文解读] MUSBO: Model-based Uncertainty Regularized and Sample Efficient Batch Optimization for Deployment Constrained Reinforcement Learning

DiJia Su, Jason D. Lee|arXiv (Cornell University)|Feb 23, 2021
Reinforcement Learning in Robotics参考文献 33被引用 6
一句话总结

MUSBO 是一种基于模型的强化学习框架,通过结合不确定性正则化的策略更新与主动数据收集,提升了在部署受限强化学习中的样本效率。它通过优先选择新颖且高质量的转移样本,并在低支持、高不确定性区域降低更新权重,实现基于不确定性的自举,从而在更少的部署次数和更少的数据下实现最先进性能。

ABSTRACT

In many contemporary applications such as healthcare, finance, robotics, and recommendation systems, continuous deployment of new policies for data collection and online learning is either cost ineffective or impractical. We consider a setting that lies between pure offline reinforcement learning (RL) and pure online RL called deployment constrained RL in which the number of policy deployments for data sampling is limited. To solve this challenging task, we propose a new algorithmic learning framework called Model-based Uncertainty regularized and Sample Efficient Batch Optimization (MUSBO). Our framework discovers novel and high quality samples for each deployment to enable efficient data collection. During each offline training session, we bootstrap the policy update by quantifying the amount of uncertainty within our collected data. In the high support region (low uncertainty), we encourage our policy by taking an aggressive update. In the low support region (high uncertainty) when the policy bootstraps into the out-of-distribution region, we downweight it by our estimated uncertainty quantification. Experimental results show that MUSBO achieves state-of-the-art performance in the deployment constrained RL setting.

研究动机与目标

  • 为解决现实世界强化学习应用(如医疗、金融和机器人)中在线交互成本高或不安全所带来的策略部署受限问题。
  • 通过受控环境交互实现高效、迭代的策略改进,弥合纯离线强化学习与在线强化学习之间的差距。
  • 在数据以批次方式收集且频率较低的场景中,提升样本效率与策略性能。
  • 开发一种框架,在每次部署期间主动发现新颖且高质量的转移样本,以提升模型准确性和策略学习效果。
  • 通过基于不确定性量化模型生成轨迹中的不确定性加权策略更新,减少分布偏移与外推误差。

提出的方法

  • MUSBO 利用学习到的环境模型在离线训练期间生成虚构轨迹,用于策略更新。
  • 应用不确定性正则化系数对策略更新进行加权,在低支持(高不确定性)区域降低影响,在高支持(低不确定性)区域增加影响。
  • 数据收集策略通过最大化新批次与先前收集数据之间的余弦距离来优化,以确保覆盖未充分探索的状态-动作区域。
  • 该框架采用部署与离线训练交替的机制:每次部署收集一批新数据,用于优化动力学模型并提升策略性能。
  • 不确定性系数源自模型的预测方差,可在分布外区域实现悲观更新,防止训练不稳定。
  • 该方法结合了不确定性正则化与主动数据收集策略,消融实验表明二者在性能与模型准确性方面具有互补作用。

实验结果

研究问题

  • RQ1不确定性正则化的策略更新是否能提升在部署受限强化学习中的样本效率与鲁棒性?
  • RQ2优先选择新颖转移的主动数据收集是否能带来更快收敛与更优策略性能?
  • RQ3不确定性正则化与数据收集策略在批量优化强化学习中,单独及联合使用时,如何影响模型准确性和累积奖励?
  • RQ4MUSBO 是否能在数据效率与最终性能方面超越现有部署受限强化学习基线方法(如 BREMEN 和 MOPO)?
  • RQ5不确定性感知自举在基于模型的强化学习中,能在多大程度上减少分布偏移与外推误差?

主要发现

  • 在 Cheetah-Run 环境中,MUSBO 仅用两次部署即达到 550 的累积奖励,而基线方法需四至五次部署才能达到相同分数。
  • 在 Walker2D 和 Hopper 环境中,总数据量为 250k 时,MUSBO 展现出显著性能优势,尤其在后期部署中,表明其学习速度更快、样本效率更高。
  • 消融实验表明,不确定性系数对累积奖励的影响强于仅使用数据收集策略,尽管后者在提升模型动力学方面更为显著。
  • 不确定性正则化与主动数据收集的结合在模型准确性(以能量距离与均方误差衡量)和最终策略回报方面均取得最佳表现。
  • MUSBO 每次部署发现的新颖转移样本数量显著多于随机或基线策略,其衡量标准为与先前数据批次的平均余弦距离。
  • 即使数据量减少(250k 对比 500k),MUSBO 仍保持强劲性能,表明其在数据受限条件下的鲁棒性与高效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。