[论文解读] Imagined Value Gradients: Model-Based Policy Optimization with Transferable Latent Dynamics Models
本文提出了一种基于模型的强化学习方法——想象价值梯度(Imagined Value Gradients, IVG),该方法利用可迁移的潜在动力学模型,从视觉和本体感觉观测中预测未来的奖励与价值。通过基于想象轨迹的梯度优化策略,IVG 实现了鲁棒且数据高效的训练,并在具有新奖励或干扰物的任务中展现出显著的迁移性能,优于模型无监督基线方法的样本效率。
Humans are masters at quickly learning many complex tasks, relying on an approximate understanding of the dynamics of their environments. In much the same way, we would like our learning agents to quickly adapt to new tasks. In this paper, we explore how model-based Reinforcement Learning (RL) can facilitate transfer to new tasks. We develop an algorithm that learns an action-conditional, predictive model of expected future observations, rewards and values from which a policy can be derived by following the gradient of the estimated value along imagined trajectories. We show how robust policy optimization can be achieved in robot manipulation tasks even with approximate models that are learned directly from vision and proprioception. We evaluate the efficacy of our approach in a transfer learning scenario, re-using previously learned models on tasks with different reward structures and visual distractors, and show a significant improvement in learning speed compared to strong off-policy baselines. Videos with results can be found at https://sites.google.com/view/ivg-corl19
研究动机与目标
- 通过学习一个通用的动力学模型,提升视觉强化学习中的样本效率与可迁移性。
- 即使使用近似模型,也能通过基于想象轨迹计算的价值梯度实现鲁棒的策略优化。
- 将预训练的潜在动力学模型迁移到具有不同奖励结构或视觉干扰物的新任务中。
- 证明对动力学模型进行多任务预训练可提升在新任务上的泛化能力与学习速度。
提出的方法
- 该方法通过想象价值梯度(IVG)训练编码器、转移和解码器网络,学习一个随机的、与动作相关的潜在动力学模型。
- 通过反向传播想象的潜在模型轨迹,计算策略梯度,使用可微分的价值函数估计。
- 利用从预测未来价值中导出的价值梯度优化策略,实现无需依赖真实环境轨迹的端到端训练。
- 在迁移学习中,使用预训练权重初始化编码器、转移和解码器,并在新任务上微调,同时从头训练策略和价值头。
- 在价值函数学习和环境交互过程中,使用交叉熵方法(CEM)进行动作优化,并采用短轨迹(N=5)以减少误差累积。
- 模型通过结合真实交互与想象轨迹进行训练,价值函数通过可微分的基于模型的未来回报预测进行估计。
实验结果
研究问题
- RQ1基于模型的强化学习方法是否能在高维视觉控制任务中实现鲁棒且数据高效的策略学习?
- RQ2一个学习到的潜在动力学模型是否能有效迁移到具有不同奖励函数或视觉干扰物的新任务中?
- RQ3在多个源任务上进行预训练是否能提升在新目标任务上的泛化能力与学习速度?
- RQ4仅使用近似模型的想象轨迹是否能实现稳定的策略优化?
主要发现
- IVG 在视觉操控任务(如抓取和堆叠)中达到与强大模型无监督基线相当的渐近性能。
- 与离策略模型无监督基线相比,该方法在数据效率方面有显著提升,尤其在低数据场景下表现更优。
- 使用预训练潜在模型进行迁移学习可显著加快新任务的学习速度,尤其当源模型在多任务上预训练时效果更明显。
- 即使超出训练范围,开环的图像和本体感觉重建在 30–45 步内仍保持一致,表明潜在动力学建模具有鲁棒性。
- 尽管图像重建存在模糊,潜在空间仍捕捉到高层级、与任务相关的特征,从而实现有效控制。
- 对动力学模型进行多任务预训练,相比孤立训练,能实现更快的收敛速度和更好的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。