[论文解读] Reinforcement Learning with Action-Free Pre-Training from Videos
该论文提出APV,一种利用无动作视频预训练的强化学习框架,以提升视觉强化学习中的样本效率和最终性能。通过在多样化、无动作依赖的视频上预训练潜在视频预测模型,并使用动作条件动力学模型进行微调,APV 通过基于视频的内在奖励实现更快的学习和更好的探索,在Meta-World任务上达到95.4%的成功率,优于DreamerV2的67.9%。
Recent unsupervised pre-training methods have shown to be effective on language and vision domains by learning useful representations for multiple downstream tasks. In this paper, we investigate if such unsupervised pre-training methods can also be effective for vision-based reinforcement learning (RL). To this end, we introduce a framework that learns representations useful for understanding the dynamics via generative pre-training on videos. Our framework consists of two phases: we pre-train an action-free latent video prediction model, and then utilize the pre-trained representations for efficiently learning action-conditional world models on unseen environments. To incorporate additional action inputs during fine-tuning, we introduce a new architecture that stacks an action-conditional latent prediction model on top of the pre-trained action-free prediction model. Moreover, for better exploration, we propose a video-based intrinsic bonus that leverages pre-trained representations. We demonstrate that our framework significantly improves both final performances and sample-efficiency of vision-based RL in a variety of manipulation and locomotion tasks. Code is available at https://github.com/younggyoseo/apv.
研究动机与目标
- 通过利用来自多样化、无动作视频的无监督预训练,提升视觉强化学习中的样本效率和最终性能。
- 实现在源域(如RLBench)中预训练的表征向未见下游域(如Meta-World和DeepMind Control Suite)的迁移,即使存在显著的域差距。
- 开发一种在微调过程中整合动作输入的方法,而无需在预训练阶段使用动作信息。
- 利用来自预训练表征的基于视频的内在奖励,增强视觉强化学习中的探索能力。
- 证明预训练的动力学表征即使在视觉差异显著的复杂环境中,也能显著加速学习并提升性能。
提出的方法
- 在大规模多样化、非结构化视频集合(如来自RLBench)上预训练一个无动作的潜在视频预测模型,以学习可泛化的动力学表征。
- 引入一种堆叠架构,将预训练的无动作模型与新的动作条件潜在动力学模型结合,用于在下游任务上进行微调。
- 使用基于世界模型的强化学习算法(DreamerV2)在目标环境中端到端微调堆叠模型,其中预训练编码器提供归纳偏置。
- 设计一种基于视频的内在奖励,利用来自预训练无动作模型的特征,通过奖励新颖的视觉动力学来鼓励探索。
- 在微调过程中应用梯度裁剪和初始学习率热身策略,以稳定训练,尤其是在整合动作输入时。
- 在预训练阶段使用对比学习目标,以鼓励学习到解耦且语义有意义的视觉动力学表征。
实验结果
研究问题
- RQ1在多样化、非结构化视频上进行无动作无监督预训练,是否能提升视觉强化学习中的样本效率和最终性能?
- RQ2在与目标域在视觉分布和任务结构上不同的源域视频上进行预训练,是否仍能获得可迁移的表征?
- RQ3堆叠架构是否能有效在微调过程中整合动作输入,同时保留来自预训练无动作表征的归纳偏置?
- RQ4基于预训练表征生成的视频内在奖励,是否能改善视觉强化学习中的探索?
- RQ5预训练在具有复杂视觉观测的挑战性运动任务中的学习动态有何影响?
主要发现
- APV在六个Meta-World操作任务上的综合成功率达到95.4%,显著优于仅达到67.9%的DreamerV2。
- 在DeepMind Control Suite的Quadruped任务上,APV结合预训练和内在奖励的表现优于基线DreamerV2,即使不使用预训练也已足够优越。
- 在Hopper Hop任务上,APV结合预训练和内在奖励从训练初期即超越DreamerV2,表明探索能力和样本效率得到提升。
- 在RLBench视频上进行的预训练,即使在视觉外观和任务结构存在巨大域差距的情况下,仍能有效迁移到Meta-World。
- 无动作视频预测模型在RLBench和Meta-World视频上生成了有意义且动态的预测,能够捕捉机器人运动和物体交互,而对Something-Something-V2的预测则模糊不清。
- 消融实验表明,预训练提供了强大的归纳偏置,显著减少了学习有用动力学表征所需的环境交互次数,尤其在训练初期阶段更为明显。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。