Skip to main content
QUICK REVIEW

[论文解读] Learning Adaptive Exploration Strategies in Dynamic Environments Through Informed Policy Regularization

Pierre-Alexandre Kamienny, Matteo Pirotta|arXiv (Cornell University)|May 6, 2020
Reinforcement Learning in Robotics参考文献 27被引用 9
一句话总结

本文提出 IMPORT,一种新颖的策略正则化方法,通过利用任务特定的有知策略提供的监督信号,训练基于 RNN 的探索策略,在显著降低样本复杂度的同时,保持了在动态、非平稳环境中的强大泛化能力和适应性。该方法在任务切换和特权信息有限的情况下,相较于 Thompson Sampling 和任务推理等先前方法,实现了更快且更鲁棒的学习效果。

ABSTRACT

We study the problem of learning exploration-exploitation strategies that effectively adapt to dynamic environments, where the task may change over time. While RNN-based policies could in principle represent such strategies, in practice their training time is prohibitive and the learning process often converges to poor solutions. In this paper, we consider the case where the agent has access to a description of the task (e.g., a task id or task parameters) at training time, but not at test time. We propose a novel algorithm that regularizes the training of an RNN-based policy using informed policies trained to maximize the reward in each task. This dramatically reduces the sample complexity of training RNN-based policies, without losing their representational power. As a result, our method learns exploration strategies that efficiently balance between gathering information about the unknown and changing task and maximizing the reward over time. We test the performance of our algorithm in a variety of environments where tasks may vary within each episode.

研究动机与目标

  • 解决在任务随时间变化的动态、非平稳环境中训练高效探索-利用策略的挑战。
  • 在不牺牲其表征能力的前提下,降低基于 RNN 的策略训练的高昂样本复杂度。
  • 通过在训练过程中结合 RNN 与任务有知策略的优势,实现实时在线适应的高效性。
  • 提升对未见任务的泛化能力,以及对无关或噪声任务描述的鲁棒性。

提出的方法

  • IMPORT 训练一个共享策略头,接收观测值以及任务嵌入或 RNN 隐藏状态,实现 RNN 与有知策略的联合学习。
  • 在训练阶段,将任务描述作为输入以训练有知策略,该策略通过正则化为 RNN 策略提供监督信号。
  • 通过一种损失函数对 RNN 策略进行正则化,以鼓励其模仿有知策略的行为,从而提升训练稳定性和收敛速度。
  • 在推理阶段,任务描述被替换为 RNN 的隐藏状态,使智能体在无法访问真实任务的情况下仍能执行动作。
  • 该方法采用多任务学习设置,智能体在具有已知描述符的一系列任务上进行训练,从而实现对未见任务的泛化。
  • 该方法通过结合稀疏奖励探索任务与非平稳控制问题进行评估,包括修改后的 CartPole 和迷宫导航环境。

实验结果

研究问题

  • RQ1能否通过在训练期间利用任务特定的有知策略,更高效地训练动态环境中的基于 RNN 的策略?
  • RQ2与 Thompson Sampling 和任务推理相比,使用有知策略进行策略正则化在样本效率和性能方面表现如何?
  • RQ3当仅使用有限的特权信息进行训练时,RNN 策略在多大程度上能泛化到未见任务?
  • RQ4与现有方法相比,该方法在面对无关或信息量极少的任务描述时,其鲁棒性如何?

主要发现

  • 在所有环境中,IMPORT 的学习速度均快于 RNN 和任务推理(TI),样本复杂度显著降低,尤其在迷宫导航任务中表现明显。
  • 在非平稳环境中,IMPORT 在适应任务变化方面优于 TS 和 TI,展现出更强的适应能力,尤其在单个 episode 内发生任务切换时。
  • 即使仅在少量任务实例上进行训练,IMPORT 也能有效泛化到未见任务,在零样本泛化设置下优于 TS 和 TI。
  • 该方法对无关或噪声任务描述保持鲁棒,而 TI 在此类条件下的性能显著下降。
  • 当 β > 0(正则化)时,IMPORT 的学习速度优于 β = 0 的情况,证实了来自有知策略的辅助监督损失具有实际益处。
  • 在泛化实验中,过拟合现象在 4×10⁶ 步后出现,表明记忆训练任务与泛化到新任务之间存在权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。